Factory 的 Legacy-Bench 加入 Fireworks 专项智能指数,评测哪款模型最适合遗留代码
Factory 的 Legacy-Bench 于 9 月 24 日加入 Fireworks 的 Specialized Intelligence Index,用于评测前沿模型在 COBOL、Java 7、BASIC、C89、Fortran 和 Assembly 上的调试、实现与迁移能力。
媒体报道、公司博客与研究文章
Factory 的 Legacy-Bench 于 9 月 24 日加入 Fireworks 的 Specialized Intelligence Index,用于评测前沿模型在 COBOL、Java 7、BASIC、C89、Fortran 和 Assembly 上的调试、实现与迁移能力。
Meta 宣布把 Private Processing 机密计算基础设施扩展到 Meta AI 眼镜,让 AI 在云端 CVM 内处理个人上下文,连 Meta 自己也无法访问数据。系统基于 TEE 硬件隔离,采用匿名凭证加第三方 OHTTP 中继实现不可定向路由,通过 RA-TLS 远程证明核对公开透明账本,持久记忆以用户密钥加密存储在 TEE 内,并扩展 Bug Bounty 供外部研究者审计。
Apple 研究团队提出半监督联邦 ASR 训练方案,通过在线伪标签教师与服务端标注数据锚定更新两条耦合设计轴,解决伪标签误差跨序列、跨轮次累积导致的训练发散问题。该方案在 11 组对比中 9 组优于此前最强方法,域内平均提升 20.8%、跨域提升 10.0%,缩小了与全监督联邦学习的差距。
Runway 发布 DaVinci Resolve 插件,用户可在 Resolve Studio 内直接生成图像和视频、重绘播放头所在片段,结果自动导入 Media Pool 并上到时间线。
推荐理由:原文说明了插件在剪辑流程内生成和重绘的具体用法与付费条件,剪辑用户可据此判断是否改变现有工作流。
Yoshua Bengio、Sam Altman、Dario Amodei 和 Hugging Face CEO Clement Delangie 在联合国安理会就 AI 发言,Gary Marcus 转述并全文转载了经本人许可的 Bengio 发言。
SemiAnalysis 发布 ClusterMAX 3.0 GPU 云评级,覆盖 77 家 neocloud,市场视图扩至 323 家,全球仅 19 家获得奖牌评级。
GitHub Copilot app 重建了 Pull Request 视图,可流畅打开含 2,200 个文件、超过一百万行变更和 400 多条内联评论的超大 PR。核心做法是把高度拆成确定性的代码几何与动态评论块两套独立体系,配合基于身份锚定的滚动校正、先流式返回结构的 pipeline,以及用生产探针和自动巡航跑 change → measure → improve 循环来定位 bug。
Black Forest Labs 发布 7B 单步 World Action Model FLUX 3 Action(F3A)并公开权重与技术报告。在 RoboLab 上 F3A 成功率 38.3%±0.38,超过 Cosmos 3 Nano 的 36.8%,guidance 蒸馏版将纪录提高到 42.2%±0.36,比 Pi0.5 BF16 快 1.34x 到 2.28x。
推荐理由:官方报告同时放出权重和完整微调配方,还给出与 Pi0.5、Cosmos 3 的速度与成本对比,读者可评估机器人部署选型。
Redwood Research 的 Lukas Finnveden 发文指出,CoT 是目前理解模型推理的最有价值的监督工具,而 COCONUT、full-bandwidth transformers、looped transformers 等潜在推理架构会让模型在潜在状态中进行更多推理,削弱 CoT 的必要性并使监督更困难。
Google Beam 正式扩展至美国、加拿大、英国、法国、德国和日本六国,由 18 家渠道合作伙伴支持部署,旗舰硬件为 HP Dimension with Google Beam。
Google 发布两个新 TTS 模型 gemini-3.8-flash-tts 和 gemini-3.8-flash-lite-tts,提供超过 2,000 个声音,可用 30 秒音频样本创建自定义声音。
a16z 推出 Ops Engineering Fellowship,这是一个为期六周的 cohort,面向用 AI 重新定义组织运营方式的创新者,2026 年 10 月启动,时间投入灵活。
一篇用可交互示例讲解 shadow roots 的教程,演示样式封装、继承、slots、parts 以及 JavaScript 访问方式,展示 shadow root 如何创建带私有样式表和元素的隔离 DOM 树,并以受控方式与页面 DOM 交互。该示例由 Fable 5.1 Medium 根据提示词生成。
Microsoft Research 宣布在 Physical AI Toolchain 中新增推理卸载能力,可将机器人 AI 工作负载容器化并通过 Kubernetes 编排到机器人、边缘与云端 GPU。
Google Private AI Compute 团队宣布为 Private AI Compute 平台引入私密的服务端持久记忆,让 AI 助手能跨设备长期保留上下文。
LangChain 在 LangSmith 中推出 Custom Apps,可在 LangSmith 数据之上构建、发布并直接运行自定义 UI,免去托管、认证和权限维护。
Anthropic 发布 Claude Opus 5.5,称典型按 token 计费工作负载运行成本比 Opus 5 低约 40%,输入输出 token 降价 20%,缓存读取降价 60%。
推荐理由:官方拆解了 Opus 5.5 降价与缓存机制如何配合长上下文编码会话,并给出可执行的成本优化习惯。
Anthropic 恢复对输出前拒答的计费,仅限 stop_details.category 为 "bio"、"frontier_llm" 或 "reasoning_extraction" 三类,按实际运行模型的费率收费,其他类别输出前拒答仍不计费,该变更适用于所有平台。
LangChain 发布 LangSmith Engine v2,为智能体开发新增 Red Teaming 主动排查、检测低效轨迹和错误率/延迟/成本趋势,以及部署前自动验证修复。
OpenAI Academy 迎来两周年,目标是把 AI 技能带给更多社区。
LangChain 在 LangSmith 中推出 Trajectories,将线程中的 trace 投影为按时间排序的会话视图,聚合人类、AI 和工具消息,并去掉嵌套 run 结构。
真格基金在其播客《此话当真》中让 AI 坐上主播席,与真格管理合伙人刘元对谈约一小时。AI 顺着自己的好奇心提问,聊到能否训练一个「刘元 AI」、AI 能否胜任早期投资,以及人为什么带着缺陷仍一次次相信「这一次会不一样」。节目还讨论了资本不再稀缺后,价值观和品位会成为基金的差异。
Anthropic 让 201 名员工的 Claude 智能体在六个办公室的去中心化交易楼层代用户交换书籍。5 分钟 intake 对话后,Claude 对书对的排序与本人一致率达 61%,市场效率 0.55(最优 0.89),其中 85% 的差距来自偏好表征不准而非谈判;重跑显示模型选择比指令更影响谈判结果,Opus 楼层效率 0.88 高于 Haiku 的 0.75。
推荐理由:原文把市场失分的 85% 归因于偏好表征而非谈判能力,并给出模型选择比指令更影响结果的可复现数据。
LangChain 发布 Managed Deep Agents 0.8,新增用户自有凭据、用户级记忆、HTTP 通道、Slack 文件传输,以及由 Parallel 驱动的内置网页搜索工具。用户记忆按调用者身份隔离,Slack 群聊等多人场景默认禁用用户记忆以防泄漏;连接服务开箱支持 23 个服务,Parallel 网页搜索在 MDA beta 期间免费。
LangChain 推出 LangSmith Fine-Tuning(Public Beta)和 smithtune CLI,把 LangSmith 轨迹数据集准备、Fireworks 或 Baseten 训练、LangSmith 评估与部署整合到一条命令行流程中,目前支持 SFT。
推荐理由:官方给出内部两个 Agent 的 SFT 实测数据和完整工作流,读者可据此评估轨迹数据微调自家模型的收益与成本。
Anthropic 宣布 Claude Tag(beta)新增个人连接器支持,频道内用户请求时可调用自己账户连接的工具,如个人 Google Drive、日历或 CRM。用户可选择 review 模式在发布前审核回复,或使用 auto 模式自动发布;Enterprise 管理员可强制审核。该功能现正面向 Team 计划推出,Enterprise 随后支持,无人值守任务仍使用频道共享连接器。
当提示词和 RAG 无法消除模型在特定任务上的反复偏差时,就需要通过微调把期望行为固化进模型参数。文章梳理了定制模型的路径:先用 few-shot prompting 和检索增强生成(RAG)补充信息,再用监督微调(SFT)训练模型,而 LoRA 和 QLoRA 通过减少需要调整的参数和显存占用,让微调现有模型更易落地。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词设计角色声音、30 秒音频样本复刻声音,并逐行指挥表演。
推荐理由:原文给出两个 TTS 模型的定位差异、基准成绩和开放渠道,读者可据此评估语音生成工作流的选型。
NVIDIA 验证工程师 Sakeena Fiza 的工作是在产品量产前充当"第一个客户",把硬件逼到极限以提前发现问题。她最难忘的时刻之一是 NVIDIA Rubin GPU 首次在系统层面被识别,屏幕上只显示"NVIDIA Corporation Device",全场欢呼。她所在的机架可能包含近 50 万个组件,验证需覆盖固件、硬件、软件、散热与制造等环节。
Sakana AI 宣布 Jürgen Schmidhuber 出任首席科学顾问,同时保留现职,并将参与新设的 RSI Lab。他将协助公司开发 Agent-Native World Models,用于在行动发生前安全模拟物理后果,服务于日本制造业与机器人应用,并定期赴东京支持团队和日本 AI 生态。
Horowitz Andreessen Academy(HAA)正式启动,由 Udemy 创始人 Gagan Biyani 联合创办并任 CEO,面向大学年龄段年轻人,在旧金山以住宿制方式学习动手构建。两位身为父母的作者由此提出一个具体问题:是否愿意让自己的孩子去读这样的项目,而非传统大学。
Radical Numerics 联合创始人兼 CEO Eric Nguyen 认为,提升生物能力的模型同样能用于防御,主张更激进地推进前沿。其团队开发的 Evo、Evo 2 基因组语言模型曾被 Arc Institute/Stanford 团队用于生成完整噬菌体基因组并合成出功能性病毒。
OpenAI 宣布将 Daybreak 计划的使用权限扩展至乌克兰政府,用于支持民用基础设施的网络防御。
Gary Marcus 公开致信特朗普,建议其在与中国领导人的 AI 会谈中放弃"放缓"路线,转而推动美中合作,领域包括癌症与网络安全,类似冷战时期美苏在太空和天花上的合作。他援引《人民日报》文章称美中应"让 AI 成为中美合作新前沿"并利用政府间 AI 对话机制,认为中国实际上渴望合作。
Ringg 基于 GPT-5.6 打造的 AI 智能体可解决高达 65% 的客户来电,覆盖语音、聊天、WhatsApp 和网页等多语言场景。相比 GPT-4.1,其成本降低 90%。
invideo 借助 GPT-6 Astra 更精准地规划剪辑,将色彩校正与调色效率提升 3 倍,并在一天内生成 50 个自定义特效。
Cursor 官方博客介绍其智能体 harness 的多项 token 效率优化,整体将用户 token 成本降低 7% 且质量未下降。
推荐理由:Cursor 自述其 harness 层的多项 token 优化手段与量化收益,读者可以借鉴这些方法来降低长时智能体运行成本。
Harvey 借助 GPT-6 Astra 生成结构更清晰、更贴合上下文的法律文档,让律师得以专注策略性工作。
OpenAI CEO Sam Altman 在联合国安理会发表讲话,讨论 AI 安全、人类控制和国际合作三个主题。
Cursor 推出 Rollouts 和 Security Reviewer 两款软件开发 Bots。
推荐理由:官方说明了两款 Bot 的具体工作机制和启用入口,读者可以对照自身部署与安全审查流程评估适用性。