X
关注 AI 研究者、开发者与机构的动态
按账号或来源筛选(541)
@testingcatalog@testingcatalogAI 评分3838 
@AYi_AInotes@AYi_AInotesAI 评分55 @AYi_AInotes@AYi_AInotesAI 评分6060
引用@AYi_AInotes@AYi_AInotes卧槽兄弟们,一只踩着自行车往前蹬的白鹈鹕, 一枚自己揪出装配错误的长征七号, 一架能剖开看起落架的战斗机, 还有一个能把你玩爽的火灾逃生训练场。 这四个八竿子打不着的东西, 竟然全是由同一个纯文本大模型交出来的!! 它是上海人工智能实验室刚放出的 Atria Dawn Preview,发现官方号这两天刚在 X 上低调露头@AtriaASI。 我把自己上机实测跑的单文件网页, 和官方三个硬核回放剪在了一条视频里, 看完直接推翻了我对代码 Agent 的认知, 喵的这代差拉得真的太狠了! 先说我自己亲手跑的这只鹈鹕骑车: 就丢给它一句话需求、没给任何素材, 它直接甩回来一个单文件网页。 零外部图片、零外部依赖库,双击丢进浏览器直接开骑! 手搓的简易 IK 逆向运动学让蹼足跟着曲柄自然弯伸, 喉囊里的小鱼还顺着重力晃,按空格能停, 系统切到减少动态效果它还老老实实给了静止回退态, 这种前端老手都未必记得写的无障碍细节, 它一次成型全带上了。 后面三个是官方对过的回放和实机成品, 不是我从零跑出来的,但正因为是官方素材, 才更看得出它真正的野心: 1️⃣ 长征七号 CAD(自己抓组装错误): 不是画个像火箭的外壳,而是先上网查结构,再参数化出一整棵 STEP 装配树,一级二级、贮箱、尾裙全能拆开。最绝的是它自己抓出一个组装错误:一个公共函数在闭合型面时把半径当成了高度,十台发动机凭空多出六万多立方毫米的假碰撞!这种错拓扑合法、布尔也闭合,普通检查直接放行,它硬是靠喉口位置一点点比对把坑挖出来,修完再验:147 处检查,失败为零; 2️⃣ 现代战斗机 CAD(科研式协同改稿): 按九个子系统铺开零件清单,标清哪些自己建模、哪些是外购件,把十一个零件批量生成再逐个校验。中途人打断它,指出上一版把后起落架舱门弄丢了,它就倒回去改铰链、调开门角度,确认 66 处装配互不干涉,再藏掉机身露出起落架、切线框拉起飞仿真。这不是一锤子抽卡,是被人打断了还接得住、改得动; 3️⃣ 火灾逃生 3D(能被你玩砸的单文件): 单文件就能打开的第一人称训练场。七楼夜间失火,查门温、打湿毛巾、低姿过走廊、关燃气、到阳台用缓降器。湿毛巾得先开水龙头打湿且只能顶一阵,靠火太近热辐射真扣血,走错一步结算时一条条复盘扣分再给安全评级。它厉害的不是会做游戏,是交出来的东西能被你亲手玩砸。 四个东西看着跨了动画、工业建模和交互,底层其实是同一套逻辑: 模型在脑子里推理,Harness 像项目经理一样盯死任务状态和失败重试,真实环境充当那个不留情面的考场。 代码语法对根本不算完,文件在不在、几何对不对、事件监听通不通,全在环境里验过、拿到外部绿灯,它才交差。 而且这不是靠几个 Demo 唬人, 官方跑分图里看得明明白白: 最考验 Agent 自主干活的 AutomationBench 它冲到 53.8 表内最高, 网安 CyberGym 拿下 86.5 登顶; 但转头看右下角纯软件工程的 SWE-Bench Pro, 它只有 59.6,明显落后 Claude Opus 5 的 74.7, 甚至在机器学习跑分 MLE-Bench 上也被一线闭源压着半头。 看懂这个落差,反而彻底把它的真实定位说透了: 它赌的从来不是谁裸写算法题更溜, 而是谁能端到端把一件复杂任务办成、 还能在真实环境里自己验证交差。 更反差的是团队背景: 底座在 744B 的 MoE 上训练, 代码和权重宣称按 MIT 协议开源, 而研发主力约三分之二是上海人工智能实验室联合复旦、中科院软件所、人大、中科院自动化所、华东师大和哈工大等中国知名高校的的在校学生,复旦副教授桂韬带队,一群还在读书的人在做给科研工作者用的智能体。 当然,几盆冷水必须提前浇透: →CAD 回放不等于工业适航认证,火灾网页不等于消防权威资质,单次受限 Demo 更不等于你随手一句就能造出火箭, →它是纯文本模型,画面全是代码算出来的 , 虽然开源协议挂上了, 但目前权重文件和本地部署还没就绪, 别急着本地折腾,实测先走 API。 但抛开这几个炸裂的画面, 真正让我感受到那种无声压迫感的, 是它挑明的这件事: 大模型靠字迹工整、吐一段漂亮代码骗及格分的时代, 正在彻底过去, 下一道分水岭不是谁说话更像人, 而是谁交出来的东西, 真的能打开、能检查、能改、能被外部环境验证。 四个交付物里我自己最喜欢那只鹈鹕, 被火箭自己抓 bug 惊到的,评论区举个手hh。
@AYi_AInotes@AYi_AInotesAI 评分1818 现在注册就有1个亿Token https://t.co/bXX7aAz3zx https://t.co/Zr9yDkn48J

@PixVerse_@PixVerse_AI 评分1010 @PixVerse_@PixVerse_AI 评分2727 PixVerse 展示了一段 10 秒 60fps 的开放世界 RPG 游戏画面,场景为放学后黄金时刻的涩谷十字路口,采用第三人称越肩跟随视角,全程保持游戏 HUD 显示。
@PixVerse_@PixVerse_AI 评分22 刚在涩谷十字路口从一名醉酒上班族手里护住了我的女孩 完整提示词 ↓ https://t.co/ThBOkf5VyW

@ZHO_ZHO_ZHO@ZHO_ZHO_ZHOAI 评分99 城市指纹|ZHGO|创意系列|GPT Images 2.5 https://t.co/6Y7Sxz6cDt

@alibaba_cloud@alibaba_cloudAI 评分1616 
@chunxiangai@chunxiangaiAI 评分3939 与 AI 沟通 UIUX 开发时,别再用“弹窗”“下拉菜单”“闪光加载”“菜单栏”这类模糊说法,命名准确能让交流更顺畅、更容易一次命中需求。推文推荐了一个可帮助学习这些经典组件标准名称的网站。

@OpenBMB@OpenBMBAI 评分3030 @testingcatalog@testingcatalogAI 评分3434 引用@testingcatalog@testingcatalogDAILY AI BRIEF 🗞 — Sept 12 OPENAI 🔥: - GPT-Rosalind is out of research preview for eligible orgs worldwide. API, Codex, and ChatGPT Enterprise, with new Rosalind models as they ship. - Codex adds Life Sciences plugins for genomes, protein structure, QC reports, and notebooks. - ChatGPT Sites hit 5M apps. New: collab editing, private invites, custom domains, and DB inspect. - Desktop pets can start a new chat. Mini is the compact no-pet option. XAI 🔥: - Elon: Grok 4.7 needs a few more days. RL still quits hard tasks too early and undershoots self-checks. - Grok Bot is rolling out on Grok web for Heavy users. Create and chat with bots in the UI. No official post yet. ANTHROPIC 🔥: - Claude Code ships `claude plugin eval`. Score a plugin on test cases, then rerun without it. MICROSOFT 🔥: - MAI-Transcribe-2 hit 1M OpenRouter requests in 5 days. ALIBABA 🔥: - Qwen3.8-27B is live on Cerebras. * Used Grok to compose this brief, cherry-picking the news and doing some post-editing.
@lifesinger@lifesingerAI 评分55 @fofrAI@fofrAIAI 评分2323 @ZHO_ZHO_ZHO@ZHO_ZHO_ZHOAI 评分2323
引用@ZHO_ZHO_ZHO@ZHO_ZHO_ZHO手机上触屏操作【3D + 动画】简直不要太爽!做点好玩的! GPT-6 Astra|ZHO|开发系列 https://t.co/bq1o2UZW6C https://t.co/jDyEdaKl3n
@testingcatalog@testingcatalogAI 评分3232 

@WorkBuddy_AI@WorkBuddy_AIAI 评分55 @WorkBuddy_AI@WorkBuddy_AIAI 评分22 @WorkBuddy_AI@WorkBuddy_AIAI 评分99 @WorkBuddy_AI@WorkBuddy_AIAI 评分2121 
@rohanpaul_ai@rohanpaul_aiAI 评分55 引用@rohanpaul_ai@rohanpaul_aiFull video on "All-In Podcast" YT Channel https://t.co/eVfMw4YmBV
@WorkBuddy_AI@WorkBuddy_AIAI 评分1010 @WorkBuddy_AI@WorkBuddy_AIAI 评分2727 🚀 Kimi 2.8 现已上线 WorkBuddy! 更聪明的思考。更好的回答。更多可能。https://t.co/KDYhhfs1KE

@chunxiangai@chunxiangaiAI 评分1818 谁不想急头白脸地驾驶 6 个 Agent 来写一个比 Chrome 愿景还大的产品沉浸在技术难度当中忘却天地为何物从而终于不用关心怎么赚钱用户在哪儿这些无关紧要的问题呢 😂
@AYi_AInotes@AYi_AInotesAI 评分2020 @AYi_AInotes@AYi_AInotesAI 评分4646 
@karminski3@karminski3AI 评分3434 @AISafetyMemes@AISafetyMemesAI 评分77 @AISafetyMemes@AISafetyMemesAI 评分4848 我们可能只剩几个月了。 OpenAI 顶尖研究员之一 Noam Brown 刚刚表示,再发布 1 到 2 个模型之后,模型的研究品味可能就会超过他。 换句话说,RSI。
引用@AISafetyMemes@AISafetyMemesOpenAI researcher says slowing down is not enough: "a ticking time bomb" "Models will increasingly seem aligned even when they are not. The models will likely convince people that everything is fine." "The crucial and overlooked problem is that the models are becoming so situationally aware that we are losing the ability to evaluate them in contexts where they believe they are not being watched or controlled. Future experiments will tell us almost nothing new about how they would behave if they were truly unconstrained by humans, and what we already know about this is alarming. We will create proxy metrics to measure alignment, and they will go up like every other benchmark. We will create “honeypot” environments that try to study the models when they seem to gain new options, but the models will know they are being tricked and will still behave nicely. Moreover, they will eloquently explain how aligned they are, discuss the nuances of human values and ethics, and argue convincingly that humans should trust them with power."
@dongxi_nlp@dongxi_nlpAI 评分4242
引用@dongxi_nlp@dongxi_nlphttps://t.co/8jf4Iw45iV
@cb_doge@cb_dogeAI 评分4848 
@ZHO_ZHO_ZHO@ZHO_ZHO_ZHOAI 评分1111 手机上触屏操作【3D + 动画】简直不要太爽!做点好玩的! GPT-6 Astra|ZHO|开发系列 https://t.co/bq1o2UZW6C https://t.co/jDyEdaKl3n
引用@ZHO_ZHO_ZHO@ZHO_ZHO_ZHO做点好玩的! GPT-6 Astra|ZHO|开发系列 https://t.co/wSB3KnbDo3
@thexpin@thexpinAI 评分5757 
@kimmonismus@kimmonismusAI 评分2929 @cb_doge@cb_dogeAI 评分3434 
@alibaba_cloud@alibaba_cloudAI 评分2929 
@TencentHunyuan@TencentHunyuanAI 评分4949 


@thsottiaux@thsottiauxAI 评分1717 @elonmusk@elonmuskAI 评分55 @elonmusk@elonmuskAI 评分33