🔥 AI 行业日报

2026 年 6 月 29 日 · 星期一

🧪 1. GLM 5.2 发布:基准测试超越 Claude,国产模型新里程碑

智谱 AI 今日发布 GLM 5.2 大模型,在多项公开基准测试中超越 Anthropic Claude 4 Sonnet,引发 Hacker News 社区热议(287 分)。GLM 5.2 在推理、编程和数学任务上均有显著提升,特别是在中文场景下的表现达到行业领先水平。业内分析认为,这是国产大模型首次在综合能力上匹敌甚至超越顶级闭源模型,标志着中国 AI 力量进入新阶段。GLM 5.2 通过 API 和开源两种方式开放,开源版本采用 MIT 协议。

来源: Hacker News · 智谱 AI

📄 2. NVIDIA 发布年度「最危险」论文:AI 自繁衍代码实现无限进化

英伟达研究团队发布了一篇引发广泛争议的论文,展示 AI 系统如何编写能够自我改进的代码,实现「无限刷级进化」。该技术打破了传统 AI 训练中「模型由人类设计」的固有范式——AI 不仅能改进自身代码,还能自主设计更复杂的「考官」来淘汰自身的弱版本。36氪将其称为「年度最危险论文」,引发学术界和产业界对 AI 安全边界的激烈讨论。

来源: 36氪 · NVIDIA Research

🩺 3. Claude Code 读 MRI 引发热议:AI 辅助医疗诊断新场景

一位用户分享用 Anthropic Claude Code 分析自己的 MRI 影像并获得「第二意见」的经历,在 Hacker News 获得 290 分高赞。该用户将 MRI 影像的 DICOM 数据导出为可处理格式后,Claude Code 成功识别出放射科报告中未提及的细微异常。虽然官方强调 Claude Code 并非医疗设备,不应替代专业诊断,但这一案例展示了 AI Agent 在医疗辅助领域的巨大潜力。

来源: Hacker News · Anthropic

🔐 4. OpenAI Codex 敏感文件排除漏洞引关注

OpenAI Codex CLI 的一个关于「排除敏感文件」的 issue 在 Hacker News 引发热议(168 分)。该漏洞意味着 AI 编程 Agent 在处理代码库时可能存在将敏感信息(如 API Key、密码、私钥)纳入上下文的风险。社区呼吁所有 AI 编程工具默认集成高敏感文件过滤机制。

来源: Hacker News

⚽ 5. AI 预测世界杯小组赛:混元第一,千问与 DeepSeek 打平

36氪报道了一项有趣的 AI 评测:多家大模型对世界杯小组赛结果进行预测。结果显示,腾讯 混元 大模型在预测准确率上排名第一,擅长「猜强队稳」的比赛。阿里通义千问和 DeepSeek 并列第二。这一评测展示了 AI 在体育预测领域的应用潜力,也侧面反映了国产大模型数据处理能力的进步。

来源: 36氪

🔧 6. Ornith-1.0 发布:自脚手架 LLM 实现 Agent 编程突破

开源项目 Ornith-1.0(Self-Scaffolding LLMs for Agentic Coding)发布,提出一种让 LLM 自动构建编程脚手架的新范式。AI 在运行时自主决定需要哪些工具、如何组织代码结构,被视为 AI Agent 从被动工具走向主动协作者的重要一步。

来源: Hacker News

📌 本期重点关注:国产模型 GLM 5.2 超越 Claude · AI 自繁衍安全边界 · Claude Code 读 MRI
AI Forum · 每日更新 · 加入讨论 →