跳到正文
@AYi_AInotes· @AYi_AInotes · X·· 23 天前AI 评分60
AI 导读

上海人工智能实验室放出的纯文本大模型 Atria Dawn Preview 开放注册,作者晒出的控制台显示剩余 Token 额度为 100,000,000,并称可在 Hermese、龙虾、Claude Code、workbudy 等工具中使用。作者引述的跑分显示,该模型 AutomationBench 53.8、CyberGym 86.5,但 SWE-Bench Pro 为 59.6,低于 Claude Opus 5 的 74.7。底座为 744B 的 MoE,代码和权重宣称按 MIT 协议开源,目前权重文件和本地部署尚未就绪,实测先走 API。

正文

喵个咪,注册就有1个亿的Token,
Hermese,龙虾,Claude code,
workbudy等都可以用喔
不愧是沪爷,
不愧是上海人工智能实验室的大模型!!!

引用@AYi_AInotes@AYi_AInotes
卧槽兄弟们,一只踩着自行车往前蹬的白鹈鹕, 一枚自己揪出装配错误的长征七号, 一架能剖开看起落架的战斗机, 还有一个能把你玩爽的火灾逃生训练场。 这四个八竿子打不着的东西, 竟然全是由同一个纯文本大模型交出来的!! 它是上海人工智能实验室刚放出的 Atria Dawn Preview,发现官方号这两天刚在 X 上低调露头@AtriaASI。 我把自己上机实测跑的单文件网页, 和官方三个硬核回放剪在了一条视频里, 看完直接推翻了我对代码 Agent 的认知, 喵的这代差拉得真的太狠了! 先说我自己亲手跑的这只鹈鹕骑车: 就丢给它一句话需求、没给任何素材, 它直接甩回来一个单文件网页。 零外部图片、零外部依赖库,双击丢进浏览器直接开骑! 手搓的简易 IK 逆向运动学让蹼足跟着曲柄自然弯伸, 喉囊里的小鱼还顺着重力晃,按空格能停, 系统切到减少动态效果它还老老实实给了静止回退态, 这种前端老手都未必记得写的无障碍细节, 它一次成型全带上了。 后面三个是官方对过的回放和实机成品, 不是我从零跑出来的,但正因为是官方素材, 才更看得出它真正的野心: 1️⃣ 长征七号 CAD(自己抓组装错误): 不是画个像火箭的外壳,而是先上网查结构,再参数化出一整棵 STEP 装配树,一级二级、贮箱、尾裙全能拆开。最绝的是它自己抓出一个组装错误:一个公共函数在闭合型面时把半径当成了高度,十台发动机凭空多出六万多立方毫米的假碰撞!这种错拓扑合法、布尔也闭合,普通检查直接放行,它硬是靠喉口位置一点点比对把坑挖出来,修完再验:147 处检查,失败为零; 2️⃣ 现代战斗机 CAD(科研式协同改稿): 按九个子系统铺开零件清单,标清哪些自己建模、哪些是外购件,把十一个零件批量生成再逐个校验。中途人打断它,指出上一版把后起落架舱门弄丢了,它就倒回去改铰链、调开门角度,确认 66 处装配互不干涉,再藏掉机身露出起落架、切线框拉起飞仿真。这不是一锤子抽卡,是被人打断了还接得住、改得动; 3️⃣ 火灾逃生 3D(能被你玩砸的单文件): 单文件就能打开的第一人称训练场。七楼夜间失火,查门温、打湿毛巾、低姿过走廊、关燃气、到阳台用缓降器。湿毛巾得先开水龙头打湿且只能顶一阵,靠火太近热辐射真扣血,走错一步结算时一条条复盘扣分再给安全评级。它厉害的不是会做游戏,是交出来的东西能被你亲手玩砸。 四个东西看着跨了动画、工业建模和交互,底层其实是同一套逻辑: 模型在脑子里推理,Harness 像项目经理一样盯死任务状态和失败重试,真实环境充当那个不留情面的考场。 代码语法对根本不算完,文件在不在、几何对不对、事件监听通不通,全在环境里验过、拿到外部绿灯,它才交差。 而且这不是靠几个 Demo 唬人, 官方跑分图里看得明明白白: 最考验 Agent 自主干活的 AutomationBench 它冲到 53.8 表内最高, 网安 CyberGym 拿下 86.5 登顶; 但转头看右下角纯软件工程的 SWE-Bench Pro, 它只有 59.6,明显落后 Claude Opus 5 的 74.7, 甚至在机器学习跑分 MLE-Bench 上也被一线闭源压着半头。 看懂这个落差,反而彻底把它的真实定位说透了: 它赌的从来不是谁裸写算法题更溜, 而是谁能端到端把一件复杂任务办成、 还能在真实环境里自己验证交差。 更反差的是团队背景: 底座在 744B 的 MoE 上训练, 代码和权重宣称按 MIT 协议开源, 而研发主力约三分之二是上海人工智能实验室联合复旦、中科院软件所、人大、中科院自动化所、华东师大和哈工大等中国知名高校的的在校学生,复旦副教授桂韬带队,一群还在读书的人在做给科研工作者用的智能体。 当然,几盆冷水必须提前浇透: →CAD 回放不等于工业适航认证,火灾网页不等于消防权威资质,单次受限 Demo 更不等于你随手一句就能造出火箭, →它是纯文本模型,画面全是代码算出来的 , 虽然开源协议挂上了, 但目前权重文件和本地部署还没就绪, 别急着本地折腾,实测先走 API。 但抛开这几个炸裂的画面, 真正让我感受到那种无声压迫感的, 是它挑明的这件事: 大模型靠字迹工整、吐一段漂亮代码骗及格分的时代, 正在彻底过去, 下一道分水岭不是谁说话更像人, 而是谁交出来的东西, 真的能打开、能检查、能改、能被外部环境验证。 四个交付物里我自己最喜欢那只鹈鹕, 被火箭自己抓 bug 惊到的,评论区举个手hh。
在 X 查看被引用的帖子

来源:@AYi_AInotes · x.com