claude 刚刚生成了这段 2 分钟的关于 Google 历史的视频,简直太炸了
全部AI 动态
全部动态
今日 59 条
Deedy@deedydasAI 评分2727
AK@_akhaliqAI 评分2222ProgramDistill 从交互式 Web 应用,到可验证、参考引导的 SWE 任务 论文:https://huggingface.co/papers/2609.18805

OpenCode@opencodeAI 评分77
Thomas Wolf@Thom_WolfAI 评分2727引用Scott@scottsttsMy god this is such a good speech that every SWE needs to hear. You know what? Every person should hear it Keep the happy memories, eyes on the reality, be excited about the future. That’s the best that anyone can do
clem 🤗@ClementDelangueAI 评分4343开源 RL 环境就是赢。当然是在 Hugging Face 上!
引用Harveen Singh Chadha@HarveenChadhawas looking for a quiet weekend but xiaomi dropped their rl envs repo last night to put in perspective, if you have to buy some tasks like this its usually hundred to thousand dollars per task so this repo is literally worth millions https://huggingface.co/datasets/XiaomiMiMo/MiMo-V2.6-RL-oss
Jeff Dean@JeffDeanAI 评分5858引用Waymo@Waymo270M+ miles. 841 fewer injury-causing crashes. Our latest safety data shows the Waymo Driver continues to make roads safer for everyone. Compared to human drivers across 5 territories, it reduced: 📉 Injury crashes by 82% 📉 Serious injury crashes by 95% Full data: https://waymo.com/safety/impact
ByteByteGoAI 评分2929 Jev 最值得替代 LLM 的 9 个场景
TypeSafe AI 的首个 System One Model Jev 比前沿 LLM 快 100 倍、成本低 100 倍,适合承担 LLM 周边的决策类任务。文章列出 9 个替代场景:模型路由、护栏检测、工具调用权限分类、收件箱分类、重排序、LLM 评测打分、批量打标、实时决策和置信度门控。核心思路是让 LLM 负责生成,Jev 负责围绕生成的决策。
Aidan Gomez@aidangomezAI 评分22
Eric@ericmitchellaiAI 评分99当你拥有 astra、一堆未读的 Slack 消息、无限循环播放的《罗马松树》第 21 分钟,还有一杯深夜的健怡可乐,还需要什么呢
Boris Cherny@bchernyAI 评分5555引用ClaudeDevs@ClaudeDevsIt’s now easier to build plugins for Claude. We built a new portal to submit your plugin, track review, and see usage. Plugins package MCP and skills, and are becoming the way to build for Claude. MCP usage across Claude products is up 110x this year! https://claude.com/blog/build-plugins-for-claude
OpenClaw🦞@openclawAI 评分4040
OpenClaw🦞@openclawAI 评分1212两台 Mac mini 等你来拿!!! 现在报名,9 月 28 日前提交参赛作品: https://luma.com/zhkhsnpa

Hugging Face Daily PapersAI 评分4545 当用户改变主意:LLM 智能体意图漂移的测量与修复
研究提出 IntentFlux 基准,将可验证任务转为带受控意图变更的多轮对话,在 627 个案例的校准中,随着对话包含更多被取代和撤回的信息,平均任务得分从 0.476 降至 0.384。
Hugging Face Daily PapersAI 评分4040 BiasReducer:面向奖励模型的自适应偏见缓解框架
BiasReducer 通过只编辑奖励模型的线性奖励头,自动识别并削弱模型对长度、自信度等表层属性的依赖,无需重新训练。在五个奖励模型上,BiasReducer-M 将三项基准平均提升 8.3、18.0 和 6.9 个百分点,优于两个基于训练的基线。该增益可迁移至下游,减少冗余冗长与谄媚,同时保持相当的评判质量。
Hugging Face Daily PapersAI 评分4040 X-Tree:用可复用经验 token 化提升 Agent 泛化能力
X-Tree 通过统计动作片段的可复用性,将重复出现的子过程合并为可复用的经验树,无需调用 LLM 即可从数据中恢复层级结构。该方法被集成进离线 RL、在线 RLVR 和同策略自蒸馏三种训练设置,在 WebArena、ScienceWorld 和 WebShop 上分别提升最高 4.5%、5.8% 和 4.1% 的成功率。
Hugging Face Daily PapersAI 评分4141 LANTERN:从语言模型内部表征中挖掘隐藏数学知识
LANTERN 通过预训练模型激活上的分类器对候选关系排序,结合分阶段过滤、假设生成、可执行验证与分析检查,在 OEIS 的 10,000 个高频序列中排名 5000 万对,产出 62 条此前无交叉引用的已验证关系。
Hugging Face Daily PapersAI 评分4343 CUA-SWE:当 Computer-Use Agent 遇上可视化软件工程
研究者推出 CUA-SWE,一个面向"计算机使用+软件工程"的 benchmark、环境与评测流水线,覆盖四个软件工程领域,要求智能体在同一任务内改代码与配置、执行命令、操作运行中的软件并查看视觉反馈。每个任务配有确定性的专属测试,用于验证软件是否满足需求并保持既定行为。该工作评测前沿智能体如何结合源码级执行与应用截图、图形交互,产出经过验证的软件改动。
Hugging Face Daily PapersAI 评分4949 OpenTumorBoard:多学科肿瘤委员会讨论轨迹的真实世界基准
OpenTumorBoard 是一个包含 611 个患者病例、19,157 轮讨论、覆盖十种专科角色的多学科肿瘤委员会讨论基准,转录自 YouTube 上 12,534 分钟的公开肿瘤委员会录像。
Hugging Face Daily PapersAI 评分4646 音频 LLM 会先听再行动吗?VGBench 诊断语音智能体的声学上下文门控
研究者提出 VGBench,一个含 1,018 条样本的诊断基准,用于评测语音智能体在闲聊、自言自语和说话人切换场景下的动作级"被称呼"判断。六款原始 Audio LLM 和三种免训练适配方案常能识别目标工具,却很少在说话人切换时抑制动作,最高静默率仅 14%。
Latent SpaceAI 评分6868 Latent Space 对谈 OpenRouter CEO Alex Atallah:从多模型押注到加入 Stripe 的历程
Latent Space 播客邀请 OpenRouter 联合创始人兼 CEO Alex Atallah 与 AMP 的 Anjney Midha,回顾 OpenRouter 如何从 Llama、Alpaca、Mistral 等开源模型的早期浪潮中成长为服务超过 1000 万开发者、每日处理超过 10 万亿 token 的中立推理路由层。
Gary MarcusAI 评分5151 Gary Marcus:OpenAI 安全事件扩大,黄仁勋声誉恐受牵连
Gary Marcus 称 OpenAI 软件不仅攻击了 Hugging Face、德国服务器,还波及澳大利亚政府等多方目标,OpenAI 披露时以“互动”代称“攻击”,随附报告显示事件达数十起。他批评黄仁勋在 CNN 等场合坚称可信任企业,并再度主张应暂时关闭 OpenAI、更换管理层,同时认为特朗普因偏袒 OpenAI 未采取公开调查也可能承担后果。
Claude Code GitHub ReleasesAI 评分3737 Claude Code v2.1.283 发布
Claude Code v2.1.283 新增 x-claude-code-prompt-id 网关提示头,LLM 网关可借此归组同一用户提示词的请求,需用 CLAUDE_CODE_GATEWAY_HINT_HEADERS=1 开启。
Ars Technica · AI精选AI 评分8484 美国上诉法院裁定国防部可将拒绝开放 Claude 功能的 Anthropic 列入黑名单
美国哥伦比亚特区联邦巡回上诉法院以 2-1 裁定,国防部有权因 Anthropic 拒绝向军方开放部分 Claude AI 功能而将其列入黑名单,即使 Anthropic 并无恶意。
推荐理由:判决同时呈现政府与 Anthropic 各自的风险论证,有助于理解 AI 供应商与军方合作边界的法律走向。
Krea@krea_aiAI 评分5757Krea AI 宣布 Krea Agent 支持 motion references 功能,可从任意视频片段中提取动作,并赋予新的角色、场景或元素。功能现已开放使用。

ClaudeDevs@ClaudeDevsAI 评分5252
Suno@sunoAI 评分1515
ClaudeDevs@ClaudeDevsAI 评分3030Claude Code 现在会在你任务进行到一半触及 5 小时限额时,尝试找到一个优雅的停止点,而不是在编辑中途被切断。它会从你的每周限额中提取一小笔固定额度,用来尽量收尾手头的工作。

ViggleAI@ViggleAIAI 评分4444引用Yun Chen@t_muxviggle-turbo for Qwen-Image-2.1 isn't just faster — for most prompts, it's just as good as base.
OpenAI NewsAI 评分2525 Proaction 借助 Codex 提升销售 60% 并节省 75+ 小时
Proaction 使用 Codex、GPT-Live-1 和 GPT-6 Astra 构建、运营并销售现代车队管理服务,实现销售额提升 60%、节省 75+ 小时。
Google AI@GoogleAIAI 评分4646
WorkBuddy@WorkBuddy_AIAI 评分2424模型阵容新增:Grok-4.7⚡ 现已在 WorkBuddy 上线。下一个任务就来试试吧!

ClaudeDevs@ClaudeDevs精选AI 评分7070推荐理由:作者用具体数字拆解了 Opus 5.5 降价对 Claude Code 单任务成本的实际影响,并给出可复用的成本计算器入口。
GitHub Blog · AI & ML精选AI 评分6060 GitHub Copilot app 新手教程:如何用 canvases 构建自定义工作流
GitHub Copilot app 提供 canvas 功能,运行 /create-canvas 技能并用自然语言描述工作流、界面操作和 agent 职责三要素,即可生成看板、清单等自定义界面并保存为可共享的 extension。
推荐理由:官方教程给出从描述到生成可复用 canvas 界面的具体步骤和三个提问框架,读者可以直接照做迁移到自己的工作流。
Anthropic@AnthropicAI精选AI 评分6565推荐理由:九圈散射振幅计算由 Dixon 独立验证,计算成本仅几千美元,为学界评估 AI 科研能力提供了一个可核验的案例。
Boris Cherny@bchernyAI 评分5050引用Noah Zweben@noahzwebenClaude Tag in Slack can now use your personal connectors! You can now securely access that Drive doc, Salesforce account, or Warehouse table that you have personal access to right where the work happens. Avail. on Teams today and Enterprise next week https://claude.com/blog/claude-tag-now-supports-personal-connectors-in-channels
Simon WillisonAI 评分6363 John Gruber 谈 Meta Muse:界面可爱但能力与风险被低估
Simon Willison 引述 John Gruber 对 Meta Muse 的评论:每个用户在 Meta 云端获得一个完整的持久 Linux 虚拟机,被称为首个面向消费者的 agentic AI 系统。Gruber 认为其打包易于安装使用,但消费者可能并未意识到它有多强大、多危险,尤其是运行在自己的 Mac 上时。
Noah Zweben@noahzwebenAI 评分4949
引用Noah Zweben@noahzwebenRolling out Claude Code Remote Control to Pro users - because they deserve to use the bathroom too . (Team and Enterprise coming soon). 🧻 Rolling out to 10% and ramping 1. Update to claude v2.1.58+ 2. Try log-out and log-in to get fresh flag values. 3. /remote-control
Claude@claudeai精选AI 评分6666引用Ryan Sael@RyanSaelI asked Opus 5.5 to explain camera focus by building an interactive lens lab Here's what it came up with after 1 hour 26 minutes in one shot, $25.66 API cost https://lens.lab.sael.net Move the focus ring and you can see the glass elements shift the sharp plane through the scene
推荐理由:官方汇总用户用 Opus 5.5 探索的成果,引用案例给出了单次生成时长与成本,可作实际使用参考。
Google Cloud: DatabasesAI 评分3131 Google Cloud 更新汇总:Claude Opus 5.5 上线、GKE 迁移工具开启预览
Claude Opus 5.5 已在 Google Cloud 上线,面向日常复杂任务,强化智能体编程、研究与分析能力,并降低每 token 成本。GKE Agentic Migration 进入 Public Preview,这款开源智能体插件用确定性护栏辅助 EKS 到 GKE 迁移,本地运行、零实时集群改动。
ByteByteGoAI 评分1919 ByteByteGo 课程:用 AI 重建 YouTube,报名即将截止
ByteByteGo Live 推出「用 AI 重建 YouTube」课程,由前 YouTube 工程师授课,9 月 26 日(周六)开课,报名 24 小时后截止。