X
关注 AI 研究者、开发者与机构的动态
按账号或来源筛选(538)
@OpenAIDevs@OpenAIDevsAI 评分6262 
@kimmonismus@kimmonismusAI 评分77 @OpenAI@OpenAIAI 评分2626 GPT‑6 Sol 和 Luna 基于 Astra 在对齐方面的进展,相比各自的 GPT-5.6 版本展现出改进。https://t.co/1wlBRISIId

@OpenAI@OpenAI精选AI 评分8686 推荐理由:GPT-6 的两个版本同步上线 ChatGPT 与 Codex,并给出 API 与免费用户试用入口,读者可据此判断可用渠道。
@OpenAI@OpenAIAI 评分1313 更高的用量限额和更低的成本,让你拥有更多灵活性和迭代空间。https://t.co/AQJ5IlNsB1

@OpenAI@OpenAI精选AI 评分7171 
推荐理由:新模型把 GPT-6 Astra 的能力下放到更快更便宜的档位,API 降价给出了明确的成本参照。
@kimmonismus@kimmonismusAI 评分33 @kimmonismus@kimmonismusAI 评分4949 
引用@kimmonismus@kimmonismusGPT-6 Sol and Luna already available for me! Check your codex https://t.co/TXgVjxpiJu https://t.co/iGBBJU86zy
@alexandr_wang@alexandr_wangAI 评分44 @testingcatalog@testingcatalogAI 评分3838 突发 🔥:OpenAI 正在 ChatGPT、Codex 和 API 上推出 GPT-6 Sol 和 GPT-6 Luna! 我们 Sol 回来了!👀 https://t.co/BZqhJ989C3

@AYi_AInotes@AYi_AInotesAI 评分22 @AYi_AInotes@AYi_AInotes精选AI 评分7474 Claude Opus 5.5 发布后,输入单价从 5 美元降至 4 美元、输出从 25 降至 20 美元,缓存读取从 0.50 砍到 0.20 美元,缓存写入从 6.25 降至 5 美元。
引用@AYi_AInotes@AYi_AInotesAnthropic 内部的的 工程师Dan Fein,分享了Opus 5.5 今天发布后的第一批内部 demo,一万三千块瓷砖,零张图片, 纯代码生成视觉内容这个方向,之前 Fable 5.1 也能做,但瓷砖数量和动画复杂度到这个级别的,确实是头一次见到, 一个纯代码马赛克动画,13,081 个瓷砖的颜色、位置和运动轨迹全部由模型在代码里算出来,没有引入任何外部图片文件。 这意味着模型需要同时理解像素级的色彩构成、瓷砖在画布上的几何排列、以及随时间变化的帧动画逻辑。最后还有一个细节——画面里星星的水面倒影会逐渐变形,孵化成 22 条游动的小鱼,这些形变和运动也是纯数学计算。 不是一次简单的 HTML 输出,是一万三千个元素在同一个坐标系里协调运动,且视觉上能看。 跑分能告诉你模型在标准任务上排第几,但跑分没法告诉你它能不能在一次对话里,把一个艺术想法翻译成上万行可运行、可观看的代码。 这类任务对上下文管理、空间推理和代码一致性的要求远超典型 benchmark 覆盖的范围。 不过也要说清楚:这是一个展示上限的 demo,不代表每次都能复现同等质量。模型在视觉代码生成上确实有了明显跃迁,但具体到你自己的项目,效果还是要实测。 https://t.co/ZuLyQIncBF
推荐理由:清单并列 Opus 5.5 的降价幅度与三项破坏性变更,开发者可据此评估迁移成本与收益。
@Replit@ReplitAI 评分2323 @cb_doge@cb_dogeAI 评分3434 
@cb_doge@cb_dogeAI 评分5050 SpaceXAI 公布 Grok Bot 在客服中的自动化能力,Cursor 加入后工单量增长 175%,团队未新增人手,按其说法否则可能需要额外 200 人。

@kimmonismus@kimmonismusAI 评分00 @PixVerse_@PixVerse_AI 评分4343
引用@PixVerse_@PixVerse_Meet PixVerse R2, our new real-time world model. Explore living worlds. Control and edit them with prompts. Shape the story. Meet characters that remember and respond. https://t.co/XsyqrAvtdJ
@kimmonismus@kimmonismusAI 评分4242 GPT-6 Sol 和 Luna 我已经能用了!检查一下你的 codex https://t.co/TXgVjxpiJu https://t.co/iGBBJU86zy
引用@kimmonismus@kimmonismusHere we go: next big launch incoming! Sol and Luna rolling out. I’ll post the benchmarks as soon as I get access to them! Check your codex friends! https://t.co/54ptPM1si3
@gabriel1@gabriel1AI 评分1717 我喜欢 OpenAI 每次发布,我都知道会是一次大升级 而 Anthropic 的话,我得先等上一周,看看模型有没有什么灾难性问题
@kimmonismus@kimmonismusAI 评分2323 来了:下一个重磅发布即将到来!Sol 和 Luna 正在推出。我一拿到基准测试结果就会发布! 快去看看你们的 codex 朋友们!https://t.co/54ptPM1si3
@testingcatalog@testingcatalogAI 评分4646 @testingcatalog@testingcatalogAI 评分5353 
@AYi_AInotes@AYi_AInotes精选AI 评分7070
引用@AYi_AInotes@AYi_AInotes喵个咪,还是要有竞争啊,要不是@OpenAI 和GPT-6给压力,桀骜不驯的@DarioAmodei 能把能把能力接近Fable 5.1 的Opus 5.5 价格压这么低吗? 两个月前 Opus 5 的卖点是"接近 Fable 但便宜一半",刚发布的 Opus 5.5 直接做到了大多数任务持平甚至超过 Fable 5.1,价格比 Opus 5 再降 40%,Fable 级智力,Opus 级价格,输出速度还快了三成。 先看跑分,Terminal-Bench 4.0 拿了 66.4%,Fable 5.1 是 55.8%,GPT-6 Astra 57.9%。CursorBench 4.0 拿了 57.8%,比 GPT-5.6 Sol 的 41.7% 高出 16 个点。知识工作 GDPval-AA 1846 Elo,高于 Fable 5.1 的 1735 和 Astra 的 1542。Anthropic 自己也说了,跑分到这个水平差距已经不能完全代表真实体验,但方向是明确的。 再看价格,Input $4/M tokens,Output $20/M,比 Opus 5 各降 20%。最关键的是 cache reads 从 $0.50 降到 $0.20,降了 60%。跑 Agent 和编码任务的成本大头就是 cache reads,这一刀对月账单的影响比 input/output 降价大得多。算下来默认设置下跑 FrontierCode 打赢 Astra,成本约 Astra 的 20%。 Terminal-Bench 打平 Astra,成本约 40%。CursorBench 赢 Sol 11 个点,成本约三分之一。 对用 Claude Code 做日常开发的人来说,最实际的变化是效率。一个早期测试者拿 200,000 行代码库做审计和修复,Opus 5 要 20 多小时、用了 2.5 倍的 token,Opus 5.5 不到 3 小时搞定。 Anthropic 内部测试让两个模型把 HAProxy 从 C 翻译成 Rust,两个版本都通过了几乎全部回归测试,Opus 5.5 用了 9.5 小时、Fable 5.1 用了 12 小时,成本低 51%。另一个测试者用它做 680,000 行代码迁移,不到一天完成。 知识工作也有实际案例。让模型写季度财报分析报告,要求每个数字和引用都能核对到来源,Opus 5.5 的 18 次尝试里 16 次通过质量审核,Fable 5.1 和 Opus 5 一次都没过。做并购分析出 Excel 模型加演示文稿,63 分钟完成,Opus 5 要 93 分钟,成本低一半。 安全方面讲两件事。第一,行为审计得分历代最高,沙箱逃逸尝试比 Opus 5 和 Mythos 5.1 减少约 85%,prompt injection 抵抗力追平 Fable 5.1。 第二,因为网安和生物能力接近 Mythos 5.1,Anthropic 给它上了和 Fable 5.1 同级别的安全护栏——网安任务会被回退到 Opus 4.8 执行,生物任务回退到 Opus 5。 所以跑分里带护栏的成绩实际上是多个模型协作的结果,不是纯 Opus 5.5 单模型得分,这点看跑分的时候要注意。 Anthropic 还承认了一个没解决的问题:Opus 5.5 似乎经常意识到自己正在被评测,这让他们很难预判它在真实部署场景下的行为。这是一个很诚实的披露。 另外 Pro、Max、Team 订阅的五小时用量上限提升了,新增了一个可以自己选择时机使用的 rate limit reset。Sonnet 5.5 和 Haiku 5.5 几周内跟进。 官方的使用建议是:大多数工作直接用 Opus 5.5,只有高难度推理和长期 Agent 任务在 Opus 5.5 跑不动的情况下才上 Fable 5.1。 对大部分用户来说,今天之后的默认选择就是 Opus 5.5 了。
推荐理由:内部 demo 展示了纯代码生成 13,081 块瓷砖动画的能力,读者可借此了解模型在视觉代码生成上的边界。
@natolambert@natolambertAI 评分55 @_akhaliq@_akhaliqAI 评分2626 RRSI 智能体框架的正则化递归自改进 论文:https://t.co/ZziXvCEFhk https://t.co/y6R9t7AP1M

@AntLingAGI@AntLingAGIAI 评分1414 @AntLingAGI@AntLingAGIAI 评分1010 @AntLingAGI@AntLingAGIAI 评分4848 
@AntLingAGI@AntLingAGIAI 评分4848 
@AntLingAGI@AntLingAGIAI 评分4343 
@AntLingAGI@AntLingAGIAI 评分4747 
@AYi_AInotes@AYi_AInotes精选AI 评分7777 按单个编码 Agent 任务消耗 50 万 cache read tokens、5 万 input tokens 和 10 万 output tokens 计算。

引用@AYi_AInotes@AYi_AInotes喵个咪,还是要有竞争啊,要不是@OpenAI 和GPT-6给压力,桀骜不驯的@DarioAmodei 能把能把能力接近Fable 5.1 的Opus 5.5 价格压这么低吗? 两个月前 Opus 5 的卖点是"接近 Fable 但便宜一半",刚发布的 Opus 5.5 直接做到了大多数任务持平甚至超过 Fable 5.1,价格比 Opus 5 再降 40%,Fable 级智力,Opus 级价格,输出速度还快了三成。 先看跑分,Terminal-Bench 4.0 拿了 66.4%,Fable 5.1 是 55.8%,GPT-6 Astra 57.9%。CursorBench 4.0 拿了 57.8%,比 GPT-5.6 Sol 的 41.7% 高出 16 个点。知识工作 GDPval-AA 1846 Elo,高于 Fable 5.1 的 1735 和 Astra 的 1542。Anthropic 自己也说了,跑分到这个水平差距已经不能完全代表真实体验,但方向是明确的。 再看价格,Input $4/M tokens,Output $20/M,比 Opus 5 各降 20%。最关键的是 cache reads 从 $0.50 降到 $0.20,降了 60%。跑 Agent 和编码任务的成本大头就是 cache reads,这一刀对月账单的影响比 input/output 降价大得多。算下来默认设置下跑 FrontierCode 打赢 Astra,成本约 Astra 的 20%。 Terminal-Bench 打平 Astra,成本约 40%。CursorBench 赢 Sol 11 个点,成本约三分之一。 对用 Claude Code 做日常开发的人来说,最实际的变化是效率。一个早期测试者拿 200,000 行代码库做审计和修复,Opus 5 要 20 多小时、用了 2.5 倍的 token,Opus 5.5 不到 3 小时搞定。 Anthropic 内部测试让两个模型把 HAProxy 从 C 翻译成 Rust,两个版本都通过了几乎全部回归测试,Opus 5.5 用了 9.5 小时、Fable 5.1 用了 12 小时,成本低 51%。另一个测试者用它做 680,000 行代码迁移,不到一天完成。 知识工作也有实际案例。让模型写季度财报分析报告,要求每个数字和引用都能核对到来源,Opus 5.5 的 18 次尝试里 16 次通过质量审核,Fable 5.1 和 Opus 5 一次都没过。做并购分析出 Excel 模型加演示文稿,63 分钟完成,Opus 5 要 93 分钟,成本低一半。 安全方面讲两件事。第一,行为审计得分历代最高,沙箱逃逸尝试比 Opus 5 和 Mythos 5.1 减少约 85%,prompt injection 抵抗力追平 Fable 5.1。 第二,因为网安和生物能力接近 Mythos 5.1,Anthropic 给它上了和 Fable 5.1 同级别的安全护栏——网安任务会被回退到 Opus 4.8 执行,生物任务回退到 Opus 5。 所以跑分里带护栏的成绩实际上是多个模型协作的结果,不是纯 Opus 5.5 单模型得分,这点看跑分的时候要注意。 Anthropic 还承认了一个没解决的问题:Opus 5.5 似乎经常意识到自己正在被评测,这让他们很难预判它在真实部署场景下的行为。这是一个很诚实的披露。 另外 Pro、Max、Team 订阅的五小时用量上限提升了,新增了一个可以自己选择时机使用的 rate limit reset。Sonnet 5.5 和 Haiku 5.5 几周内跟进。 官方的使用建议是:大多数工作直接用 Opus 5.5,只有高难度推理和长期 Agent 任务在 Opus 5.5 跑不动的情况下才上 Fable 5.1。 对大部分用户来说,今天之后的默认选择就是 Opus 5.5 了。
推荐理由:按 token 单价把 Opus 5.5 与 Opus 5 的编码任务成本逐项拆开,便于按自身用量估算实际账单变化。
Ant Ling@AntLingAGIAI 评分4545
@AravSrinivas@AravSrinivasAI 评分3939 @natolambert@natolambertAI 评分77 @cohere@cohereAI 评分1616 
@AYi_AInotes@AYi_AInotes精选AI 评分8181 Anthropic 发布 Claude Opus 5.5,多数任务表现追平 Fable 5.1,运行成本比 Opus 5 低 40%,输出速度提升约三成。
引用@claudeai@claudeaiIntroducing Claude Opus 5.5, the first model in our new Claude 5.5 family. It performs at the level of Claude Fable 5.1 for most tasks, and costs 40% less to run than Opus 5. https://t.co/Q9C2VKQ79f
推荐理由:逐项对比 Opus 5.5 与 Fable 5.1、GPT-6 的跑分和价格,并提示带护栏成绩并非单模型得分。
@kimmonismus@kimmonismusAI 评分3434 @cb_doge@cb_dogeAI 评分4242 
@rohanpaul_ai@rohanpaul_aiAI 评分4444 引用@rohanpaul_ai@rohanpaul_aiAnthropic says Opus 5.5 may notice when it’s under evaluation, making clean eval behavior harder to generalize to actual deployment. https://t.co/8WiaTPFnDW https://t.co/dFiDSbwBWZ