X
关注 AI 研究者、开发者与机构的动态
按账号或来源筛选(540)
@steipete@steipeteAI 评分1111 @trq212@trq212AI 评分2727 @trq212@trq212AI 评分2020 例如“搜索 Slack 和 Git,就这次事件发生了什么写一份报告”是好的 “写一条让我显得体贴又暖心的消息”或“做一份关于 AI SDLC 的幻灯片”是坏的
@Thom_Wolf@Thom_WolfAI 评分3535 引用@EpochAIResearch@EpochAIResearchAI is getting cheaper more quickly than any other transformative tech in history. At a given level of performance, cost has fallen ~47%/quarter since 2023. That’s 4× faster than DNA sequencing, 6× faster than compute, 18× faster than lithium batteries, and (up to 1973) 54× faster than electricity.
@steipete@steipeteAI 评分5353 Peter Steinberger 在 X 上建议给编码智能体设定带量化目标的清理指令,否则只说清理会让它过早停止。他给出的示例是移除 20% 最没用的测试,同时把代码覆盖率变化控制在 2% 以内。
@steipete@steipeteAI 评分5353 @alexandr_wang@alexandr_wangAI 评分11 @Replit@ReplitAI 评分4141 我们的屏幕时间要没了 https://t.co/l3l2kubXRa (引用推文:Muse 现在可以在 Replit 里做应用了。🚀)
引用@Replit@ReplitMuse can now make apps in Replit. 🚀 https://t.co/rl3T891XUe
@odysseyml@odysseymlAI 评分3232
Odyssey@odysseymlAI 评分4343推出 Agora-2,我们的新一代多智能体世界模型。 Agora-2 支持最多 20 个人类与智能体在同一共享环境中互动,全部实时模拟。 我们的多人研究预览版现已开放体验!

@odysseyml@odysseyml精选AI 评分6969 Odyssey 发布 Agora-2 研究预览,最多支持 4 名人类组队对战 16 个智能体,整个环境由世界模型实时模拟。官方表示该环境底层没有游戏引擎。

推荐理由:官方演示世界模型在不依赖游戏引擎的情况下实时模拟多人对战环境,可供观察世界模型的交互能力边界。
@alexandr_wang@alexandr_wangAI 评分00 事实上,我们在 msl 每天都这么穿 如果你同意条款,就可以加入我们:https://t.co/CbxQvK1VDQ https://t.co/89JlYpK4SM
@ClementDelangue@ClementDelangueAI 评分77 @deedydas@deedydasAI 评分2020
Luma@LumaLabsAIAI 评分2626@omarsar0@omarsar0AI 评分1111 @omarsar0@omarsar0AI 评分2323 
@AYi_AInotes@AYi_AInotesAI 评分4141 Matt Pocock 用一组词典式定义区分了软件工厂与暗工厂:真正的软件工厂由生产环境告警、工单和监控指标触发,模型在后台自主改代码、跑单测、提改动,工程师只保留关键门禁审核。


@deedydas@deedydasAI 评分99 显然 3blue1brown 还是更好。视频对任何读者来说都比真正去读那些长篇晦涩的学术术语要容易接受得多。是理解一篇论文基本思路的好方法 论文:https://t.co/B9xxhU0k6J
@deedydas@deedydasAI 评分4141 
@omarsar0@omarsar0AI 评分2828 新一波 System One 模型出现,Contrastive Language Model(CLM)比 Jev 快 9 倍,且在长程任务上似乎是更好的验证器。
@alexandr_wang@alexandr_wangAI 评分44 @AYi_AInotes@AYi_AInotesAI 评分5252
引用@AYi_AInotes@AYi_AInotes这几天创投圈被 DeepSeek 的第二轮融资传闻刷屏了,什么 75 亿美元、40 亿验资进场、首日市值喊到 4.5 万亿,甚至还有 GP 担心资质不够把手里所有 LP 都报上去当备胎。 刚看到这些数字的时候,我第一反应也是觉得太夸张了,甚至觉得二级市场的狂热情绪是不是又把一级市场给绑架了。 但跟几位业内做交易的朋友聊了聊,把那些被过度放大的数字和炒作剥离掉,真正触动我的其实不是钱多,而是整个资本链条上权力的彻底颠倒。 以前我们看大模型融钱,剧本大家都很熟悉:创始团队带着 PPT 飞满全国,在一间间会议室里陪投资人算账、讲商业化、签各种严苛的回购条款,姿态放得极低。说白了,那时候资本是绝对的老爷,创业团队是求生者。 但这次 DeepSeek 这盘局,哪怕传闻里水分再多,有一个事实是圈内公认的:它在反过来挑资本,而且挑得极其苛刻。 那些平时习惯了被创业者捧着的钱,这次拿着几十亿资金证明在门外排队,还要被层层穿透、审查背景,甚至大批资金因为背景不够纯粹、诉求偏短期投机,直接被刷了下来。 这是一种很微妙、但在国内创投史上罕见的震撼。 为什么能做到这一步?说到底,商业世界最残酷也最迷人的地方就在这里:当一家公司用极度克制的算力成本、硬碰硬的开源影响力和实打实的调用营收,把工程效率做到了别人看不懂的地步时,它就拥有了不用向资本低头的底气。 它要的不是谁给的估值高,而是在万亿参数集群和全球合规深水区里,谁能成为不添乱、不短视、能在背后稳稳扛事的长期盟友。 资本是聪明的,但资本也是现实的。当技术不再是讲给投资人听的故事,而是变成了直接降维打击行业成本的武器,资本就只能放平身段,反过来接受工程师的挑选。 不管这笔传闻最终交割公布的真实名单是谁,我都觉得这件事给整个行业提了个醒: 在技术底层真正跑出断层优势的公司面前,任何单纯靠砸钱吹泡沫的幻觉,其实都脆弱得不堪一击。
@lifesinger@lifesingerAI 评分2323 @PixVerse_@PixVerse_AI 评分11 @kimmonismus@kimmonismusAI 评分55 @PixVerse_@PixVerse_AI 评分2525 
@kimmonismus@kimmonismus精选AI 评分7575 

推荐理由:小米 MiMo-V2.6-Pro 领跑开源权重模型,且每任务成本远低于闭源对手,读者可据此观察开源模型的性价比变化。
@lifesinger@lifesingerAI 评分1919 @opencode@opencodeAI 评分5454 @Replit@ReplitAI 评分3535 Muse 现在可以在 Replit 中制作应用了。🚀 https://t.co/rl3T891XUe

@douglance · XAI 评分2727 Griz:一种更快、更节省 token 的文件编辑方式
Griz 在 Hacker News 的 Show HN 上亮相,主打更快、更节省 token 的文件编辑方式。该内容由 Twitter 链接分享,发布当日获得 1 个 HN 积分。
@alexandr_wang@alexandr_wangAI 评分1212 muse 爱代码!我们雇他当吉祥物之前,他其实通过了所有编程面试 @github 🤝 @Muse 很期待看到大家用这个做出什么!https://t.co/Dm1tcbGWCN
Peter McCrory@PeterMcCroryAI 评分2626引用Institute of Politics@HarvardIOPWhat happens to jobs, productivity, inequality, and economic policy as AI transforms the way we work? Anthropic Chief Economist @PeterMcCrory and economist @JasonFurman took to the JFK Jr. Forum stage to explore these questions and more. https://ken.sc/forum0923-live
@alexandr_wang@alexandr_wangAI 评分77 不好意思,我必须纠正这一诽谤的不实记录 https://t.co/xNHfLwM5I7 https://t.co/RDVcNzZy6d

@AYi_AInotes@AYi_AInotesAI 评分4848 @AYi_AInotes@AYi_AInotesAI 评分4141
引用@AYi_AInotes@AYi_AInotesAnthropic 创始人 Dario Amodei今天凌晨那篇 ART 长文,一个早上就刷到了 300 多万浏览, 里面有一句我反复看了好几遍,数学可以纯靠推理,生物必须做实验, 但很少有人注意到,昨晚刚发了免费科研工作台 ScienceBuddy 的 @PhAILabs,上周四还开源了一个项目 ScienceIDE,把验证这一关,直接做成了 AI 的对账考场, 上周四,9 月 17 号,其实有两件重磅的事同时落地, →一边是 Anthropic 公布,Claude 用不到四周,优化了 AlphaFold3、Boltz-2 在内的 30 多个生物学 AI 模型,代码全部开源, →另一边是 ScienceIDE,把天体物理的 Athena++、海洋气候的 MITgcm、等离子体的 Gkeyll、暗物质探测的 NEST、量子纠错的 Stim 等 7 个学科的真实科研代码,封装成了 15 套 AI 能动手训练的环境, 判分只认一条铁律, 改完的代码算出来的科学结果,必须和基准参考结果逐点吻合, 跑通不算,对了才算, 就拿 MITgcm 来说,海洋和大气之间氟利昂交换的模块里,埋了一个 bug, AI 要自己找到,自己修好, 合不合格,不看代码写得漂不漂亮,只看最终输出能不能一个点一个点对上, 一开始我也觉得,不就是修个 bug 吗, 后来才反应过来,写业务代码,写错了有编译器和单测当场拦住你, 科学代码里最吓人的 bug,偏偏不报错, 程序照样跑完,曲线照样好看,只是海洋吸收的氟利昂悄悄偏了一点,后面整条气候推论,就跟着一起偏, 拿写业务代码的标尺去量科研 AI,量出来的多半是假及格, 难度也摆在明面上, 最难的 85 道题,8 家厂商的 15 个模型,表现最好的首次尝试正确率是 67.1%, 差不多每三道,还有一道拿不下, 另外说句实在的,现在绝大多数任务是代码修复和重构,加速类任务还在早期, 我反而觉得挺好,考场没被刷穿,才有练的价值, 两件事放在一起,味道就出来了, Anthropic 证明了 AI 有能力改进真实的科学软件,ScienceIDE 想给 AI 一个跨学科练这类活的地方, 团队还说,准备把 Anthropic 开源的优化方案也封装成训练环境,把前沿的做法,变成大家都能拿来练的标准题, 做过科研的人都懂,调代码、排 bug、适配工具、核对结果,能耗掉一个博士生大半的时间, 以前聊 AI 做科研,聊的多半是读文献、写综述、出思路, 现在它开始下到各学科的代码库里,干这些最磨人的活,还要对着基准结果一个点一个点交账, ScienceBuddy现在免费开放,思路是让科研智能体在和研究者的长期协作里,一轮一轮变强, 同一个团队,一边做给 AI 练兵的考场,一边做给科研人当副驾的工作台, 生物学靠湿实验室验证,计算科学靠和基准结果逐点对账, 论文读得再多,综述写得再漂亮,到了几万行的模拟代码面前,还是得把每一个数都对上。
François Chollet@fcholletAI 评分2828@kimmonismus@kimmonismusAI 评分22 不错 :) 连 Elon 都喜欢 :D https://t.co/76PPvjuhdY

@PixVerse_@PixVerse_AI 评分88