今天的 AI 新闻看下来,主线挺明显:模型开始自己做研究和验证,机器人也开始根据真实世界的结果继续改进。办公 Agent 则在快速进入公司日常。下面聊五条消息。 Anthropic 公布,Claude 用了 11 天,基本自主地把费马大定理的完整证明写成 Lean 代码,并交给计算机逐步检查。整个过程写出了约 1300 万行 Lean,证明了 29500 个中间定理。重要的不是“AI 证明了著名定理”这句热闹话,而是验证方式变了。人类数学证明可能要专家审查几年,Lean 则能把每一步逻辑交给机器核对。以后 AI 能不能可靠地产出和验证数学,可能会成为科研工具的一道分水岭。 GitHub 发布了 Copilot 的研究预览项目 HydraFusion。它会在运行时决定,是直接让一个模型完成,先用便宜模型起草再升级,还是让另一个模型批评后再修改。GitHub 的离线测试显示,在 TerminalBench 2.1 上,任务质量比 Opus 5 高 4.9 个百分点,估算成本低 67%。模型竞争正在从“谁的单项分数最高”,转向“怎么把多个模型组合得更划算”。以后开发者选的可能不是一个模型,而是一套会自己分工的工作流。 量子位报道,星尘智能发布 SmoothRL,解决机器人边执行、模型边推理时的训练问题。机器人不能停下来等模型算下一段动作,新的计划还可能替换旧计划的后半段。SmoothRL 只让真正执行过的动作参与强化学习。在真实测试里,动态投掷成功率从 39% 提到 94%,给笔戴帽从 8% 提到 83%,开箱从 30% 提到 90%。机器人到了真实环境后,也能针对几毫米的偏差和半拍的延迟继续修正。 openJiuwen 的 ScienceDiscovery 把科研代码的反复试错做成了树搜索。模型不用重新训练,程序会自己挑一个旧版本继续改,放进沙箱评分,再决定深挖还是换分支。一个振荡积分任务在 2 小时里生成 236 个版本,代码加速测试的平均加速达到 2.279 倍。它很像让 AI 自己做实验,但前提是结果必须能自动打分。验证越快,AI 能自己试的次数就越多。 办公 Agent 的竞争也在加速。量子位称,千问办公上线满一个月,用户数超过 3000 万,企业用户占比过半,一个月更新了 120 个版本。它把消息、文档、审批和业务系统里的信息整理成 Agent 能调用的上下文,还优化了多步规划和工具选择。办公 AI 正从“帮我写一段话”走向“帮我查信息、跨系统办事、整理结果”。最后比的不是宣传数字,而是能不能接进工作流程,出了错又能不能管得住。 把这几条放在一起看,AI 正从单次回答走向持续工作:先规划,再执行,再检查,最后根据结果继续改。模型会继续变强,但真正拉开差距的,可能是验证、协作和安全边界。