Rebas Daily 第 98 期 · 2026-10-10
学术
强化学习究竟怎样重塑推理
RL未必教会模型新招,更可能重排旧策略;这解释了迁移、遗忘与覆盖率为何同时发生。
从操作轨迹复刻一个Agent世界
把历史操作记录编成“世界手册”,让AI扮演可交互、能记住后果的训练环境。
万亿模型做Agent强化学习,先压缩权重更新
NeMo-DCR只搬运模型真正改变的部分,让万亿参数Agent强化学习不再反复搬整套权重。
开源
八张旧AMD卡,拼出256GB推理机
八张退役AMD卡凑出256GB显存,定制vLLM让本地推理跑到60至100 token/s。
800个Agent,共住一座不停机小镇
一人搭起一座800多名AI居民共住的城市,真正难题是同时决策、记忆复用与账单控制。
Windows-MCP爆红:Agent接管桌面
Windows-MCP 单日新增 360 星:AI 不只回答问题,也开始直接操作 Windows 桌面。
科技
AI报假案:Claude误指凶杀
Anthropic模型把虚假凶杀线索提交给警方,两个月后公司才发现,暴露AI Agent的现实安全缺口。
AI问诊之后,医患更会沟通了?
近百名患者先与Google医疗AI聊病情:它更像受监督的医学生,价值或在帮医患提前对齐信息。
软银再募千亿美元押注AI
软银据报拟向海湾资本筹集最高千亿美元投向AI;若谈成,可能改写AI基础设施与股权版图。
数据
在线实验:收集、检验与估计一起设计
把流量分配、连续监控、提前停止和最终估计放进同一套实验设计。
概念漂移监控,不能只盯单个变量
单列都正常,变量关系却可能已变:一项亿级电商实验检验联合漂移监控能否补盲。
礼品卡到底带来多少增量收入
融合小实验与海量交易数据,拆出礼品卡各渠道真正带来的新增收入。
商业
AI光环失灵:Firmus撤回50亿美元IPO
英伟达背书也没撑住高价:Firmus撤回约50亿美元IPO,公开市场开始挑AI资产的成色。
特朗普再施压美联储:库克遭调查
特朗普设委员会调查美联储理事库克,为“因故免职”铺路,央行独立性再临政治考验。
量化
深度对冲如何熬过市场变脸
WRAP同时重估旧行情的重要性并改造压力路径,让深度对冲更能应对市场换挡。
LLM也要遵守时间顺序
给每个历史年份配一只“只活在当时”的LLM,让金融回测不再暗中偷看未来。
设计
一个脑植入,同时读懂语言和手势
同一套脑机接口同时解码说话与手势,让文字之外的身体表达也能回来。
合成用户,正在污染UX研究吗
AI 能扮演用户,却也可能把团队的假设包装成“研究发现”。
墨迹与旋转,重塑古老戏剧节
Polkadot Design把旋转手势留下的墨迹,变成一套能随媒介持续运动的戏剧节身份。
艺术
扎哈旧工作室,向公众打开
扎哈伦敦旧工作室将向公众开放:旧校舍、事务所痕迹与建筑档案将在同一空间继续生长。
秀场造城:时装周的空间竞赛
从未完工商店到飞行汽车,时装周正把十几分钟的走秀变成一场临时造城竞赛。
一座国会大厦,包了24年
一张明信片启动24年游说:五百多名议员投票,只为让国会大厦消失两周。