Odyssey 发布 Agora-2 研究预览,最多支持 4 名人类组队对战 16 个智能体,整个环境由世界模型实时模拟。官方表示该环境底层没有游戏引擎。
推荐理由:官方演示世界模型在不依赖游戏引擎的情况下实时模拟多人对战环境,可供观察世界模型的交互能力边界。
关注 AI 研究者、开发者与机构的动态
Odyssey 发布 Agora-2 研究预览,最多支持 4 名人类组队对战 16 个智能体,整个环境由世界模型实时模拟。官方表示该环境底层没有游戏引擎。
推荐理由:官方演示世界模型在不依赖游戏引擎的情况下实时模拟多人对战环境,可供观察世界模型的交互能力边界。
事实上,我们在 msl 每天都这么穿 如果你同意条款,就可以加入我们:https://t.co/CbxQvK1VDQ https://t.co/89JlYpK4SM
Matt Pocock 用一组词典式定义区分了软件工厂与暗工厂:真正的软件工厂由生产环境告警、工单和监控指标触发,模型在后台自主改代码、跑单测、提改动,工程师只保留关键门禁审核。

显然 3blue1brown 还是更好。视频对任何读者来说都比真正去读那些长篇晦涩的学术术语要容易接受得多。是理解一篇论文基本思路的好方法 论文:https://t.co/B9xxhU0k6J
新一波 System One 模型出现,Contrastive Language Model(CLM)比 Jev 快 9 倍,且在长程任务上似乎是更好的验证器。
这几天创投圈被 DeepSeek 的第二轮融资传闻刷屏了,什么 75 亿美元、40 亿验资进场、首日市值喊到 4.5 万亿,甚至还有 GP 担心资质不够把手里所有 LP 都报上去当备胎。 刚看到这些数字的时候,我第一反应也是觉得太夸张了,甚至觉得二级市场的狂热情绪是不是又把一级市场给绑架了。 但跟几位业内做交易的朋友聊了聊,把那些被过度放大的数字和炒作剥离掉,真正触动我的其实不是钱多,而是整个资本链条上权力的彻底颠倒。 以前我们看大模型融钱,剧本大家都很熟悉:创始团队带着 PPT 飞满全国,在一间间会议室里陪投资人算账、讲商业化、签各种严苛的回购条款,姿态放得极低。说白了,那时候资本是绝对的老爷,创业团队是求生者。 但这次 DeepSeek 这盘局,哪怕传闻里水分再多,有一个事实是圈内公认的:它在反过来挑资本,而且挑得极其苛刻。 那些平时习惯了被创业者捧着的钱,这次拿着几十亿资金证明在门外排队,还要被层层穿透、审查背景,甚至大批资金因为背景不够纯粹、诉求偏短期投机,直接被刷了下来。 这是一种很微妙、但在国内创投史上罕见的震撼。 为什么能做到这一步?说到底,商业世界最残酷也最迷人的地方就在这里:当一家公司用极度克制的算力成本、硬碰硬的开源影响力和实打实的调用营收,把工程效率做到了别人看不懂的地步时,它就拥有了不用向资本低头的底气。 它要的不是谁给的估值高,而是在万亿参数集群和全球合规深水区里,谁能成为不添乱、不短视、能在背后稳稳扛事的长期盟友。 资本是聪明的,但资本也是现实的。当技术不再是讲给投资人听的故事,而是变成了直接降维打击行业成本的武器,资本就只能放平身段,反过来接受工程师的挑选。 不管这笔传闻最终交割公布的真实名单是谁,我都觉得这件事给整个行业提了个醒: 在技术底层真正跑出断层优势的公司面前,任何单纯靠砸钱吹泡沫的幻觉,其实都脆弱得不堪一击。


推荐理由:小米 MiMo-V2.6-Pro 领跑开源权重模型,且每任务成本远低于闭源对手,读者可据此观察开源模型的性价比变化。
Muse 现在可以在 Replit 中制作应用了。🚀 https://t.co/rl3T891XUe
Griz 在 Hacker News 的 Show HN 上亮相,主打更快、更节省 token 的文件编辑方式。该内容由 Twitter 链接分享,发布当日获得 1 个 HN 积分。
muse 爱代码!我们雇他当吉祥物之前,他其实通过了所有编程面试 @github 🤝 @Muse 很期待看到大家用这个做出什么!https://t.co/Dm1tcbGWCN
What happens to jobs, productivity, inequality, and economic policy as AI transforms the way we work? Anthropic Chief Economist @PeterMcCrory and economist @JasonFurman took to the JFK Jr. Forum stage to explore these questions and more. https://ken.sc/forum0923-live
不好意思,我必须纠正这一诽谤的不实记录 https://t.co/xNHfLwM5I7 https://t.co/RDVcNzZy6d
Anthropic 创始人 Dario Amodei今天凌晨那篇 ART 长文,一个早上就刷到了 300 多万浏览, 里面有一句我反复看了好几遍,数学可以纯靠推理,生物必须做实验, 但很少有人注意到,昨晚刚发了免费科研工作台 ScienceBuddy 的 @PhAILabs,上周四还开源了一个项目 ScienceIDE,把验证这一关,直接做成了 AI 的对账考场, 上周四,9 月 17 号,其实有两件重磅的事同时落地, →一边是 Anthropic 公布,Claude 用不到四周,优化了 AlphaFold3、Boltz-2 在内的 30 多个生物学 AI 模型,代码全部开源, →另一边是 ScienceIDE,把天体物理的 Athena++、海洋气候的 MITgcm、等离子体的 Gkeyll、暗物质探测的 NEST、量子纠错的 Stim 等 7 个学科的真实科研代码,封装成了 15 套 AI 能动手训练的环境, 判分只认一条铁律, 改完的代码算出来的科学结果,必须和基准参考结果逐点吻合, 跑通不算,对了才算, 就拿 MITgcm 来说,海洋和大气之间氟利昂交换的模块里,埋了一个 bug, AI 要自己找到,自己修好, 合不合格,不看代码写得漂不漂亮,只看最终输出能不能一个点一个点对上, 一开始我也觉得,不就是修个 bug 吗, 后来才反应过来,写业务代码,写错了有编译器和单测当场拦住你, 科学代码里最吓人的 bug,偏偏不报错, 程序照样跑完,曲线照样好看,只是海洋吸收的氟利昂悄悄偏了一点,后面整条气候推论,就跟着一起偏, 拿写业务代码的标尺去量科研 AI,量出来的多半是假及格, 难度也摆在明面上, 最难的 85 道题,8 家厂商的 15 个模型,表现最好的首次尝试正确率是 67.1%, 差不多每三道,还有一道拿不下, 另外说句实在的,现在绝大多数任务是代码修复和重构,加速类任务还在早期, 我反而觉得挺好,考场没被刷穿,才有练的价值, 两件事放在一起,味道就出来了, Anthropic 证明了 AI 有能力改进真实的科学软件,ScienceIDE 想给 AI 一个跨学科练这类活的地方, 团队还说,准备把 Anthropic 开源的优化方案也封装成训练环境,把前沿的做法,变成大家都能拿来练的标准题, 做过科研的人都懂,调代码、排 bug、适配工具、核对结果,能耗掉一个博士生大半的时间, 以前聊 AI 做科研,聊的多半是读文献、写综述、出思路, 现在它开始下到各学科的代码库里,干这些最磨人的活,还要对着基准结果一个点一个点交账, ScienceBuddy现在免费开放,思路是让科研智能体在和研究者的长期协作里,一轮一轮变强, 同一个团队,一边做给 AI 练兵的考场,一边做给科研人当副驾的工作台, 生物学靠湿实验室验证,计算科学靠和基准结果逐点对账, 论文读得再多,综述写得再漂亮,到了几万行的模拟代码面前,还是得把每一个数都对上。
不错 :) 连 Elon 都喜欢 :D https://t.co/76PPvjuhdY
原来 ChatGPT Astra 能做一个带真实操控的赛车游戏 有 Blender 粗模引导,一切都能撑住 https://t.co/ut82AncNdy




特朗普在与习近平会面后表示,超级智能(SI)将是重要讨论议题,但他希望让 AI 保持现状,并称这也是中国的立场,美国的护栏是 DOJ。Kim 认为这一表态终结了关于 AI 放缓的讨论。
* 暂不可用 说明:主推文内容为“* Not available yet”,没有可翻译的实质内容,因此标题和正文只能如实反映“暂无内容”,无法按常规规则补全主体。
GOOGLE 🔥:Nano Banana 2.5 Flash 的踪迹已在 Google Flow 上被发现。 快了?👀 https://t.co/5Og0K39vZX