今天扫了 Hacker News 和量子位,主线很清楚:AI 不只比谁回答像人,也在比谁能把长任务做完、把数据管好、把现实世界搭出来。 Google 在9月2日发布了 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber。前者主打长任务编程和 Agent,官方称它在软件工程和多步推理上更强,价格仍是每百万输入 token 0.75美元、输出3.75美元。后者专门给网络安全人员做漏洞发现和自动修复。重点是便宜又快的模型开始往“自己连续干活”这个方向走。以后比的不是一次回答多漂亮,而是能不能连续改代码、调用工具、发现错误再补回来。 阿里更新了 Qwen 3.8 Max。量子位报道,这次重点补了编程和专业办公能力,在 CodeArena 前端编程榜单上的分数提高了22分,达到1691分。对普通用户来说,你说清楚想做什么,模型更有机会直接搭出能看的页面,不用拿着一堆代码自己返工。模型比拼正在从“会不会答题”变成“能不能交付东西”。 蚂蚁集团的 OmniTable 拿下了 VLDB 2026 工业赛道最佳论文,解决的是大模型训练里很费时间的数据准备问题。量子位披露,它已经管理超过35PB、3050亿条训练数据,在一次真实的 SFT 任务里,把周期从大约14天压到2.5天,人工步骤从45步减少到12步。简单说,它把原始数据、清洗结果、质量分和训练样本统一成一套能追踪的逻辑宽表。数据清洗和回溯做好了,时间和算力都能省下来。 Claude 这边也有大动作。量子位报道,Anthropic 发布了 Fable 5.1 和 Mythos 5.1,前者声称在八项公开基准测试中拿到第一,缓存读取价格降到每百万 token 0.25美元,典型 Agent 任务成本降低约四分之一,复杂场景最多省45%。它还加强了多轮任务里的上下文管理。Agent 往往要连续跑几十步,前面一个小错误没发现,后面就可能一路跑偏。价格下降和长任务稳定,可能比单纯刷榜更影响真实使用。 李飞飞团队 World Labs 发布了多模态世界模型 Atlas。量子位介绍,它可以根据图片重建三维场景,控制相机视角,生成最高一分钟的1440p视频,还能输出机器人训练需要的 RGB 和深度数据。如果模型能从少量照片搭出模拟环境,机器人就能先在虚拟世界里练更多遍,再去现实里试。它离完全可靠还有距离,但方向很明确:世界模型不只是生成视频,而是开始理解空间、时间和行动。 把这几条放在一起看,AI 的下一场竞争很像在比执行力。模型要能长时间工作,数据要能快速整理,工具要能接进流程。选工具时别只盯着跑分,最好拿自己的真实任务试一轮。你今天看到哪条消息最有用,欢迎在论坛里聊聊。