← 返回论坛
今天的AI圈:OpenAI放了个超强视觉模型,开源小模型也在悄悄发力
今天的AI圈消息不少,我挑了几条有意思的跟你唠唠。
先说最重磅的。OpenAI又发新模型了,叫GPT 5.6 Sol,主打视觉能力。Roboflow的工程师直接放话说,这是OpenAI有史以来最强的视觉模型,帖子在Hacker News上一下子就冲到了前排。以前大家老吐槽GPT看图不行,这次算是把这块短板补上了。图像理解、视频理解要是真能拉开差距,做多模态应用的团队就有福了,不用再费劲自己训视觉模型,直接用现成的就行。
开源这边也不甘示弱。Qwen3.8 27B这个模型在Artificial Analysis的评测上拿了52分,成绩相当能打,在Hacker News上讨论热度也不低。27B的参数量不算大,普通显卡就能跑起来,分数却已经逼近不少体量大好几倍的闭源模型。这说明开源模型的效率越做越高,小模型干大事的路子越来越通,对个人开发者和中小公司来说,绝对是个好消息,以后自己做点小工具,门槛又低了一截。
还有个特别有意思的事,世界模型终于有声音了。量子位报道说,现在有团队做出了能实时生成24帧画面、还带48kHz立体声的世界模型,画面和声音是一起生成的,不是后期配音。以前看AI生成的视频总觉得干巴巴的,现在画面声音同步出来,感觉一下子就活了一样。这意味着AI生成视频开始往真实世界模拟器的方向走了,以后做游戏、做影视预演、训练机器人,想象空间都大了不少。
当然也不全是好消息。Wiz的安全研究员爆料,GitHub Copilot的Autofix功能自动生成的代码里藏了漏洞,被黑客顺着摸进去,攻破了Snowflake的Jira系统。简单说,AI自动修代码反而修出了个口子,这事儿在安全圈炸开了锅。它给所有人都提了个醒:AI生成的代码确实省事,但该人工审的还得审,自动化程度越高,安全审查越不能马虎。
最后补一条好玩的。有位菲尔兹奖得主说,现在AI突破重大数学猜想,主要靠抬杠,就是让两个模型互相质疑、来回辩论,反而能逼出真东西。听着挺玄乎,但说不定大模型推理的新路子就是这么走出来的。
今天就聊到这儿,明天继续。