深度专题 FEATURES — 3
Splink 5:十亿行实体匹配开源化
Splink 5 把概率实体匹配推向十亿行,但 8.5 分钟纪录有严格条件。
Iceberg小文件从1000压到6,查询快了多少
把1000个Iceberg小文件合成6个,二手摘要称三类SQL中位耗时改善31%至63%,但并非通用答案。
看不全实验状态,流量该怎么分
一项JASA研究把“看不全状态”的在线实验纳入流量分配,尝试在延迟反馈与时间依赖下更准地估计效果。
速览 BRIEFS — 7
NEWS
DuckDB开始用自然语言条件过滤数据
Jev把自然语言判断变成带概率的类型化结果,让DuckDB能像组合普通条件一样做语义筛选。
NEWS
Airbnb不用用户身份也能做个性化
Airbnb用地理邻近人群的汇总偏好,为匿名访客即时提供个性化推荐。
PAPER
只有目标总体摘要,也能适配分布漂移
只拿到目标人群的分组均值和人数,也能用自适应的一步更新修正旧模型。
PAPER
双边平台实验,不能只按被分流者分析
双边实验只分析参试对象会低估效果;EARL同时校正曝光与入选概率。
PAPER
多变点检测改走自底向上扫描
从小段向上合并,尽量不漏掉挤在一起的高维序列变点。
PAPER
AI基准测试也需要一种可执行语言
Benchy把任务、数据和评分写成可执行规范,减少AI评测中的实现偏差。
PAPER
缺失模式变化会击穿共形覆盖率
跨医院部署时,“哪些检查没做”会改变患者构成,让总体达标的预测保障在特定人群中失效。