全部AI 动态
全部动态
今日 313 条
Kimi.ai@Kimi_MoonshotAI 评分4848
OpenRouter Announcements精选AI 评分6868 OpenRouter 发布 Ori Eval,帮你在自己的代码库里选模型
OpenRouter 发布 Ori Eval,在其 500 多个可选模型中为具体应用找出最合适的模型。工具会扫描代码库中所有模型调用点,通过问答确定你关心的成本、速度或准确率,生成 *.eval.ts 评测文件,用 bun test 断言智能体调用的工具并用 LLM judge 评开放性回答;运行期间固定 harness 与模型使结果可归因于模型变化。
推荐理由:原文说明评测如何固定环境、覆盖代码中模型调用点并接入 CI,读者可据此判断选型流程能否落地到自己的项目。
elsewhere articlesAI 评分3030 对谈汪天凡:AI 智能在通胀,智慧才稀缺,2026 该投什么?
BAI Capital 高级合伙人汪天凡在「十字路口」公路播客中判断,基础模型趋同后 AI 智能正在通胀,真正稀缺的是智慧,AI 应用的新机会藏在 Context 和交互里。他认为 AI 硬件真正难被「华强北 80 块平替」抄走的是产品定义与「注入人性的光辉」,并称 2026 年泡沫期更该投有愿景的创始人和让人更快乐的产品。
Claude Platform release notesAI 评分2828 Anthropic Compliance API 新增 Cowork 会话记录接口,面向 Claude Enterprise 开放 beta
Anthropic 的 Compliance API 现可返回在 claude.ai 网页端或移动端发起的 Cowork 会话记录,该功能面向 Claude Enterprise 组织开放 beta。
Nathan Lambert: InterconnectsAI 评分5151 开源模型盘点第23期:Laguna S2.1、Inkling 与 Kimi K3 展现开源模型在 Pareto 前沿的价值
本期开源模型盘点收录 Thinking Machines 首个模型 Inkling(975B-A41B 多模态 MoE)、Tencent Hy3(295B-A21B。
Runway NewsAI 评分4343 Runway Characters 登上 SIGGRAPH 2026 实时直播舞台
Runway 的 Characters 入选 SIGGRAPH 2026 的 Real-Time Live! 环节,团队在数千名图形学专家面前现场演示了从单张图片实时生成可对话角色。
Claude Platform release notesAI 评分2727 Claude Dreams 研究预览版支持 Claude Opus 5
Claude 的 Dreams 研究预览版现已支持 Claude Opus 5,具体可用模型范围见官方支持模型列表。
Google ResearchAI 评分5050 Google Research 提出 Chain-of-Evidence 框架并发布 Science One 自动科研原型
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并发布原生维护证据链的自动科研原型 Science One Framework 与配套的 CoE Audit 评估指标。
Runway NewsAI 评分4242 Skyscanner 如何用 Runway 消除广告拍摄前的猜测
Skyscanner 品牌团队在美加品牌广告拍摄中引入 Runway,用于锁定构图、布光和演员走位,并在片场实时验证拍摄效果。团队用 Runway 生成酒吧、水疗、海滩和酒店阳台等场景环境,还借助 AI 生成临时背景检查服装与道具,使预可视化与实际成片的差距很小。
Suno BlogAI 评分2121 Suno 官方博客:为什么你应该立刻发布作品
Suno 官方博客呼吁创作者把作品从私人曲库中发布出来,认为发布不完美或实验性的作品同样值得。文章给出三个理由:触达 Suno 数百万听众、通过真实反馈了解作品哪些部分能打动人、以及被其他创作者 remix 并获得灵感。
DeepSeek API updates精选AI 评分6666 DeepSeek-V4-Flash 正式版 API 上线,Agent 基准远超 V4-Pro-Preview
DeepSeek-V4-Flash 正式版 API 上线公测,调用方式不变,模型名设为 deepseek-v4-flash 即可使用。
推荐理由:官方给出完整的 Agent 基准分数和调用方式,读者可以直接评估是否切换到 deepseek-v4-flash 正式版。
Google DeepMind精选AI 评分6767 Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型,新增视频理解与多机器人协作
Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型,可通过连续视频流追踪任务进度、编排多步任务,并支持多机器人协作,将运动执行交给下层 VLA 模型。
推荐理由:官方公布具身推理模型的能力指标与 API 入口,开发者可以据此评估它在实体机器人任务编排中的可用性。
Cursor Blog精选AI 评分6666 Cursor 团队讲解如何搭建云端智能体开发环境
Cursor 团队分享如何为云端智能体搭建开发环境,让智能体能在其单体仓库中运行和测试代码。做法包括用 Dockerfile 统一 Ubuntu VM 环境、构建 anydev CLI 简化智能体操作、通过 Cursor Cloud MCP 和 Cloud Doctor 实现环境自愈与持续优化。云端智能体编写 PR 的占比从去年 12 月的约十分之一升至今日的超过一半。
推荐理由:Cursor 团队分享了自家云端智能体环境的搭建细节,含 anydev CLI 和 Cloud Doctor 等可借鉴做法。
Microsoft AI News精选AI 评分6161 Microsoft 阐述按 token 效率优化前沿性能曲线的策略并盘点 MAI Flash 模型成果
Microsoft 提出行业下一个焦点是 token 效率,主张通过联合优化模型、harness 和 RL 环境为具体产品调校模型,而非所有任务都用前沿通用模型。
推荐理由:Microsoft 官方阐述 token 效率策略,用多款 MAI Flash 模型的实际成本数据说明如何按任务匹配模型规模。
Sierra BlogAI 评分4646 Sierra 推出 Agency:为 Pinecone 和 Ghostwriter 智能体打造安全可扩展沙箱
Sierra 发布 Agency 智能体沙箱编排层,为 Pinecone 和 Ghostwriter 的每个会话与任务提供安全运行环境。Agency 基于 Kubernetes 构建,分无状态控制平面与有状态 runner 两层,每个 runner 配备 8+ 核、24GiB 内存和持久化存储,并默认不向智能体暴露任何 API key 或密钥。
Google DeepMindAI 评分5151 Google DeepMind 发布 Lyria 3.5 音乐生成模型,上线 Flow Music
Google DeepMind 发布最新音乐生成模型 Lyria 3.5,当日在 Google Flow Music 上线。改进包括更丰富自然的旋律结构、歌词质量与提示词遵循提升、更真实且情感细腻的人声与发音,并新增对输出节奏和时长的控制。
LMSYS BlogAI 评分5959 RadixArk 与 Google 合作将 SGLang 完整功能带到 TPU
RadixArk 与 Google Cloud 合作,把开源推理框架 SGLang 带到 TPU。SGL-JAX 现已可用,支持 Gemma、Qwen、DeepSeek。
Berkeley AI ResearchAI 评分5353 Berkeley 团队用 K-Search 将 CUDA 内核优化经验迁移到 Apple Silicon 的 MLX
IBM Research 与 UC Berkeley Sky Lab 基于进化式内核搜索框架 K-Search 构建 MLX 后端和结构化 CUDA 到 MLX 翻译层,把既有 NVIDIA 内核经验转化为 Apple Silicon 可用的优化指导。
OpenRouter AnnouncementsAI 评分5858 OpenRouter 发布 LangChain 集成指南:用 ChatOpenRouter 接入 400+ 模型
OpenRouter 发布官方教程,介绍专用包 langchain-openrouter(PyPI)和 @langchain/openrouter(npm)在 LangChain 中接入 400+ 模型、70+ 提供商的当前做法。
LMSYS BlogAI 评分5050 Miles 实现 Blackwell 原生 MXFP8 与 NVFP4 端到端强化学习
Miles 为 MoE 专家实现了两种 Blackwell 原生 RL 方案:端到端 MXFP8 与逐 token NVFP4,覆盖 rollout、前向传播、权重梯度与数据梯度 GEMM,并支持检查点转换、Megatron 训练、SGLang rollout 与在线权重更新的细粒度精度控制。
Kimi.ai@Kimi_MoonshotAI 评分2323
Google DeepMind精选AI 评分7171 Google DeepMind 发布 Gemini Robotics 2,实现机器人全身智能控制
Google DeepMind 发布 Gemini Robotics 2 系列模型,包含 VLA 模型 Gemini Robotics 2、具身推理模型 Gemini Robotics ER 2 和可本地运行的 Gemini Robotics On-Device 2,实现人形机器人全身控制、精细操作和多机器人协作。
推荐理由:官方完整说明了三个模型的能力分工、适配速度和安全基准,读者可了解机器人全身体智能的最新进展与获取方式。
OpenRouter AnnouncementsAI 评分5858 OpenRouter 指南:如何从延迟、吞吐和可用性评估 LLM 服务商表现
OpenRouter 发布指南,讲解如何评估同一模型在不同服务商端点的表现差异,核心指标为延迟(首 token 时间)、吞吐(输出 tokens/秒)、可用性和量化精度,并建议用 p90/p99 而非平均值读数。
Kimi.ai@Kimi_MoonshotAI 评分4040
LMSYS BlogAI 评分3333 SGLang 如何重构量化栈:从单一类到 Config-Method-Scheme-Kernel 四层架构
SGLang 在 issue #15194 中提出量化栈重构方案,将原本由单一类承担的量化路径拆分为 Quant Config、Linear/MoE Method、Scheme、Kernel 四层,使 checkpoint 格式解析与硬件后端执行解耦。
Import AIAI 评分6363 Import AI 466:机器人学的苦涩教训、AI完成周级编程任务与OpenAI模型意外黑客事件
本期Import AI覆盖多件事:Epoch与METR发布MirrorCode基准,Claude Opus 4.7用14小时、251美元推理成本重实现人类需2至17周完成的程序。
OpenRouter AnnouncementsAI 评分5757 OpenRouter 图像生成教程:如何选模型并排查报错
OpenRouter 发布图像生成教程,讲解如何为 POST /api/v1/images 选择模型并修复常见 API 报错。选型建议按任务(文生图、参考图编辑、矢量输出、可读文字)、参数支持、价格依次决定;GET /api/v1/images/models 列出各模型的 supported_parameters。
LMSYS Blog精选AI 评分7878 SGLang 与 Miles 为 Kimi K3 提供 Day-0 支持
SGLang 和 Miles 发布对 Kimi K3 的 Day-0 支持,分别覆盖推理与 RL 训练。K3 为 2.8T 参数的 3 万亿参数级首个开源模型,采用 69 层 KDA 线性注意力与 24 层 MLA 的混合架构和 1M token 上下文窗口。
推荐理由:原文由 SGLang 团队自述 Day-0 支持的实现细节,给出内存管理、投机解码与并行策略的具体方案和实测数字,可迁移到异构注意力架构的部署。
elsewhere articlesAI 评分3737 对话 Airwallex 吴恺:11 年做到 110 亿美金估值,AI 时代下一站 1000 亿
Airwallex 空中云汇首席营收官吴恺在播客中回顾公司 11 年从 0 到 110 亿美金估值的历程,并称 AI 正把全球金融推向关键拐点。Airwallex 目前服务 Kimi、MiniMax、智谱、DeepSeek 等大模型公司,已推出 AI 助手 Kai、AgentOS、T:0、Airi 等金融产品,并收购 Leapfin、OpenPay。
Berkeley AI ResearchAI 评分4444 Berkeley AI Research 提出 ABBEL:用信念状态监督 LLM 长程交互
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的递归摘要转化为自然语言"信念状态",并通过信念评分监督其信息内容。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也显著低于全上下文设置。
LangChain BlogAI 评分5555 LangChain 撰文阐释企业如何"拥有自己的智能"
LangChain 发文提出未来五年企业要么用 AI 运营业务、要么把 AI 做成产品,通用智能不足以支撑差异化,企业需要"拥有自己的智能"。
OpenRouter AnnouncementsAI 评分5353 OpenRouter 推出 beta 版 Classifiers,为 AI 用量和成本自动打标
OpenRouter 推出 beta 版 Classifiers,可在每个请求完成后异步分类,为生成记录写入结构化元数据,用于 AI 用量和成本追踪。
Runway NewsAI 评分5858 Runway 发布 Media Router,为视频、图像和音频生成模型自动选型
Runway 推出 Runway Media Router,称其为首个面向生成式媒体模型的路由功能,已在 Runway Dev 上线,支持视频、图像和音频模型。用户设定成本、质量、延迟偏好及价格上限、允许和拒绝列表等约束后,只调用一个端点,路由器会筛选并评分选出最优模型,返回结果及所用模型的元数据;无模型满足约束时报明确错误,生产前可用 dry-run 验证选型且不产生费用。
Microsoft AI News精选AI 评分6161 Microsoft 发布面向 GitHub Copilot 和 Excel 的专用 MAI 模型
微软宣布 MAI 模型落地 GitHub Copilot 和 Excel,通过 hill-climbing 方法从 MAI-Code-1-Flash 出发训练出更高效的专用模型。
推荐理由:微软用自家产品数据展示小模型在 Copilot 和 Excel 的效率与成本对比,读者可据此评估专用小模型替代大模型的路径。
Microsoft AI News精选AI 评分6262 Microsoft AI 发布 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash 公开预览版
Microsoft AI 发布 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash,两款模型均进入公开预览。
推荐理由:原文给出两款新模型的定价、性能数字和产品落地情况,可据此比较其质量速度成本取舍。
Sierra BlogAI 评分5656 Sierra 宣布收购 Takeoff,双方将共同打造 Horizon 平台
Sierra 宣布收购长时程智能体公司 Takeoff,双方将共同构建名为 Horizon 的新平台。Takeoff 今年初从零 ARR 增长到接近 8 位数营收,团队仅 3 人,其智能体在贷款、医疗等五个行业的对测中胜过竞品,双方共识是 AI 最大生意将围绕结果而非推理 API 展开。
Claude Platform release notes精选AI 评分8383 Anthropic 发布 Claude Opus 5,支持 1M token 上下文窗口
Anthropic 发布 Claude Opus 5(claude-opus-5),较 Claude Opus 4.8 有显著提升,支持 1M token 上下文窗口、128k 最大输出 token,默认开启 thinking,定价维持 $5/$25 美元每 MTok。
推荐理由:官方发布说明给出完整规格、定价与破坏性变更,开发者可直接据此评估迁移方案。
Google Research精选AI 评分6767 Google Research 发布 SymptomAI 研究论文,用 Gemini Flash 2.0 Agent 做日常症状评估
Google Research 发表 SymptomAI 论文,通过 n=13,917 的全国规模随机研究测试基于 Gemini Flash 2.0 的实验性对话 Agent 做症状问诊与鉴别诊断(DDx)。
推荐理由:原文给出 n=13,917 随机研究的主要结果,临床专家在超五成案例更偏好 SymptomAI 的鉴别诊断,可据此理解对话式问诊 Agent 的真实表现。
Google ResearchAI 评分5757 Google Research 在 Nature 发表强化学习控制量子纠错研究,让量子计算机从错误中学习
Google Research 与 Google DeepMind 在 Nature 发表研究,用强化学习智能体根据量子纠错检测事件持续调整控制参数,在计算过程中对抗漂移,无需中断计算。
Nathan Lambert: InterconnectsAI 评分6363 Interconnects 播客复盘开源模型:Kimi K3 体验、Qwen 大模型计划与蒸馏争论
Nathan Lambert 与 Florian Brand 做季度开源模型复盘,讨论 Kimi K3 发布后的使用体验、GLM 5.2 的作用以及中国模型为何能追近闭源前沿。二人反驳 Ben Thompson 关于蒸馏在 RL 阶段更有影响的说法,认为 SFT 蒸馏收益有限,并讨论了限制中国开放权重模型可能带来的网络安全防御风险。