#Agent
#Agent
今日 5 条
X.PIN@thexpinAI 评分5656
Hacker News popular via buzzing.ccAI 评分6767 Cloudflare 发布开源决策模型 Clef 与 Clef-flash,并推出 RL 微调服务
Cloudflare 发布两个自研决策模型 Clef 和 Clef-flash,托管在 Workers AI 并以 Apache 2.0 许可开源到 Hugging Face,与 Jev-API 完全兼容。
Artificial Analysis@ArtificialAnlys精选AI 评分7070
推荐理由:原文给出三大新模型组合在 Coding Agent Index 的得分与单任务成本对比,读者可以据此在性能和价格之间做选型权衡。
Odyssey@odysseymlAI 评分2828今天我们推出 PROWL-2,智能体及其世界模型通过递归学习实现改进。 智能体暴露想象中的错误,修复这些错误又能促成进一步的学习。 我们相信,这种开放式学习是迈向超级智能的关键一步。

TechCrunch · AIAI 评分5656 AWS 发布开源决策模型 Strands Decider 2B,基于 Qwen3.5-2B
AWS 发布开源决策模型 Strands Decider 2B,灵感来自 TypeSafe 的 Jev,可在预设选项间高速低成本地做选择并给出置信度。模型完全开源、可本地运行,由 Amazon 杰出工程师 Marc Brooker 的内部项目改进而来,基于 Qwen3.5-2B 的架构但不生成文本,而是输出校准后的选择,同一周 OpenAI 也宣布了类似产品。
OpenRouter@OpenRouterAI 评分4545Latent SpaceAI 评分7474 Google DeepMind 发布 Gemini 4 Argon,支持 1M 输出 token
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作和网络防御,自称在 19 项基准中的 13 项排名第一,输出上限提升到 1M token(此前为 64K)。
The Decoder精选AI 评分7979 Google 发布 Gemini 4 Argon,追赶 OpenAI 与 Anthropic 但未取得明确领先
Google 发布新旗舰模型 Gemini 4 Argon,是其七个多月来首款前沿模型,Artificial Analysis 测试中得 53 分,与 GPT-6 Astra (max)、Claude Fable 5.1 持平,但仍落后 Claude Opus 5.5 的 58 分。
推荐理由:原文汇总了第三方测试与定价细节,指出 Gemini 4 Argon 缩小差距但未领先,且单价优势来自低 token 价格而非效率。
Karina@karinanguyenAI 评分5252引用Google DeepMind@GoogleDeepMindIntroducing Gemini 4 Argon – our new frontier model. It’s built for complex workflows across coding, enterprise knowledge work, and cybersecurity defense – rolling out today to a set of trusted testers through our Fairwind Program.
Google DeepMind精选AI 评分7474 Google DeepMind 发布 Gemini 4 Argon,输出上限扩至 1M tokens
Google DeepMind 发布前沿模型 Gemini 4 Argon,先向 Fairwind Program 的可信网络防御者开放,后续将面向开发者、企业和消费者推出。
推荐理由:官方博客给出定价、输出上限和多个基准成绩,可帮读者评估该模型在编码与安全防御场景的实际定位。
Qwen@Alibaba_QwenAI 评分3737Qwen3.8-27B 现已通过 @nebiustf 开放使用。无论你是在构建智能体还是做深度研究,这个 27B 稠密模型都已为你的多步骤工作流准备就绪!🥳
引用Nebius Token Factory@nebiustfQwen3.8-27B is now live on Nebius Token Factory. A compact 27B dense model for coding, research, and agent workflows, with a focus on planning and completing tasks across multiple steps. Start building: https://tokenfactory.nebius.com/endpoints?modals=endpoint-details&model-id=Qwen/Qwen3.8-27B
Microsoft Research精选AI 评分6161 Microsoft Research 发布生物研究领域 AI 系统 Quine
Microsoft Research 推出 Quine,一个面向生物学的多模态世界模型与交互式 harness,连接科学工具、文献和研究人员。在与 Broad Institute 合作中,Quine 用于预测可驱动胰腺癌肿瘤细胞状态转变的化合物,排名第一的候选化合物在湿实验中产生了最大的预期细胞状态转变,从缩小化合物范围到确定候选名单仅用了一个周末。
推荐理由:官方披露了系统构成和胰腺癌湿实验验证结果,读者可以据此评估AI世界模型在生物研究中的实际作用。
ClaudeDevs@ClaudeDevs精选AI 评分8383
推荐理由:指南覆盖模型选型、迁移调参和 Claude Code 使用三方面,开发者可直接对照迁移工作流。
Hugging Face Blog精选AI 评分7575 H Company 发布 Holo4 系列通用计算机操作智能体模型
H Company 发布 Holo4 智能体模型系列,包含 27B dense 和 35B-A3B MoE 两个尺寸,并附带基于 Nemotron 3 Nano Omni 后训练的 Holotron4 Nano。
推荐理由:官方发布给出了跨 GUI、代码、MCP 和 API 四类接口的统一智能体模型,附基准分数和完整轨迹数据,适合评估开源方案与闭源模型的成本差距。
Anthropic Newsroom精选AI 评分8585 Anthropic 发布 Claude Sonnet 5.5:速度提升 30% 以上、单任务成本最多降 30%
Anthropic 发布 Claude Sonnet 5.5,为 Claude 5.5 家族第二款模型,生成速度比 Sonnet 5 快 30% 以上,测试中单任务成本最多低 30%。
推荐理由:官方发布给出了与 Sonnet 5 和 Opus 5.5 的多项基准对比、定价和成本数据,读者可以据此判断它在自己场景下是否值得迁移。
karminski-牙医@karminski3AI 评分5959
引用Meituan LongCat@Meituan_LongCatLongCat-2.5-Preview is now live. 1.6T parameters. ~48B active. A 1M-token context window. Natively multimodal. Built to take on long-horizon tasks. From terminals and browsers to GUIs, spreadsheets, and design tools. Try it now: 🚀 API: https://longcat.ai/platform/ 💬 Chat: https://longcat.ai/chat/
karminski-牙医@karminski3AI 评分3636
inclusionAI Hugging Face models精选AI 评分6262 inclusionAI 开源 Ling-flash-2.0:100B 总参数、6.1B 激活的 MoE 模型
inclusionAI 正式开源 Ling 2.0 架构下的第三个 MoE 大语言模型 Ling-flash-2.0,总参数 100B、激活参数 6.1B(非嵌入 4.8B),基于 20T+ tokens 数据训练并经 SFT 和多阶段强化学习。
推荐理由:官方给出参数结构、基准对比和推理速度数据,读者可据此评估小激活 MoE 替代 40B 稠密模型的可行性。
inclusionAI Hugging Face models精选AI 评分6262 inclusionAI 开源万亿参数思考模型 Ring-2.5-1T
inclusionAI 发布开源万亿参数思考模型 Ring-2.5-1T,采用 1:7 MLA + Lightning Linear Attention 混合线性注意力架构,激活参数从 51B 增至 63B。
推荐理由:原文给出了混合线性注意力的具体效率数字和多项基准成绩,读者可以据此评估它在长程智能体场景中的实际取舍。
inclusionAI Hugging Face models精选AI 评分6262 inclusionAI 开源 Ling-2.5-1T:1T 总参数、63B 激活的即时模型,支持 1M 上下文
inclusionAI 发布并开源 Ling-2.5-1T,总参数 1T、激活 63B,预训练语料扩至 29T tokens,经 YaRN 外推支持最长 1M tokens 上下文。
推荐理由:官方模型卡给出架构、token 效率和长上下文评测细节,可帮助读者评估这款万亿参数即时模型对现有部署工作流的适配。
inclusionAI Hugging Face models精选AI 评分6060 inclusionAI 开源万亿参数模型 Ling-2.6-1T
inclusionAI 开源 Ling 家族旗舰模型 Ling-2.6-1T,参数量达 1T,面向复杂推理、编码和 Agent 工作流。
推荐理由:官方发布万亿参数旗舰开源模型,给出架构设计、benchmark 结果和 SGLang/vLLM 部署细节,便于评估其实际可用性。
inclusionAI Hugging Face models精选AI 评分6969 inclusionAI 正式开源 Ling-2.6-flash:104B 总参数、7.4B 激活的混合线性 MoE 模型
inclusionAI 正式开源 instruct 模型 Ling-2.6-flash,总参数 104B、激活 7.4B,采用 1:7 MLA + Lightning Linear 混合线性注意力与高稀疏 MoE 架构。
推荐理由:官方给出架构细节、340 tokens/s 推理速度和 15M tokens 评测用量等数据,也坦承工具幻觉局限,读者可据此评估高频率 Agent 部署场景的适配度。
inclusionAI Hugging Face models精选AI 评分6060 inclusionAI 发布万亿参数推理模型 Ring-2.6-1T
inclusionAI 发布万亿参数旗舰推理模型 Ring-2.6-1T,主打真实生产环境中的 Agent 执行与复杂推理,上下文长度由 128K 扩展到 256K(YaRN),采用 MIT License 开源。
推荐理由:官方发布页给出 Agent 执行、推理档位和异步 RL 训练的具体做法与基准数字,读者可据此评估其在生产场景的适配价值。
inclusionAI Hugging Face modelsAI 评分5757 inclusionAI 发布原生多模态模型 Ling-3.0-flash-VL
inclusionAI 发布 Ling-3.0-flash-VL,基于 Ling-3.0-flash 扩展原生图像与视频理解,总参数 124B,每 token 激活 5.5B,上下文窗口最高 256K tokens。
inclusionAI Hugging Face modelsAI 评分5656 inclusionAI 发布 Ling-3.0-flash 混合推理模型,124B 总参数激活 5.1B
inclusionAI 在 Hugging Face 发布 Ling-3.0-flash,为原生混合线性注意力 MoE 模型,总参数 124B、每 token 激活 5.1B,约为此前 1T 级旗舰 Ring-2.6-1T 的 12.4% 和 8.1%,官方称在关键基准上持平或超越前代。
inclusionAI Hugging Face modelsAI 评分5959 inclusionAI 发布 Ling-3.0-tiny:7.9B 总参数、1.3B 激活的混合推理 MoE 模型
inclusionAI 发布轻量混合推理 MoE 模型 Ling-3.0-tiny,总参数 7.9B,每 token 仅激活 1.3B,采用 3:1 KDA-MLA 混合线性架构加 128 专家稀疏 MoE FFN。
inclusionAI Hugging Face modelsAI 评分4646 蚂蚁 Ling 系列发布 Ling-3.0-flash-Fin 金融增强模型,124B 参数、256K 上下文
蚂蚁集团联合多家金融机构与领域专家推出 Ling-3.0-flash-Fin,这是 Ling 系列首个金融增强模型,在 Ling-3.0-flash 基础上用高质量金融数据继续训练,总参数 124B、激活参数 5.1B、上下文窗口 256K。
Latent Space精选AI 评分8585 Anthropic 发布 Claude Opus 5.5,OpenAI 同日跟进低价 GPT-6 Sol 与 Luna
AINews 汇总 Claude Opus 5.5 发布:作为 Claude 5.5 家族首个模型,官方称多数任务达到 Fable 5.1 水平、比 Opus 5 快约 30% 且每任务便宜约 40%,token 单价从 $5/$25 降至 $4/$20,并成为 Claude Code 与 Claude 应用的新默认模型。
推荐理由:汇总了 Opus 5.5 与 GPT-6 Sol/Luna 同日发布的基准、定价与第三方评测,含实际每任务成本与争议细节,便于对比两家宣传口径。
Ant Ling@AntLingAGIAI 评分4646引用Vals AI@ValsAIAnt Group’s Ling 3.0 Flash Fin is a finance-specialized open-weight model that delivers strong financial analysis at budget-model pricing. On Finance Agent v2, it scores 54.9% at just $0.045 per task.
Ant Ling@AntLingAGIAI 评分4545
karminski-牙医@karminski3AI 评分5252karminski 发布小米 MiMo-v2.6-pro 测试速报,向量数据库测试得分从 MiMo-v2.5-Pro 的 2505 升至 7810,接近 Claude Fable-5。




Latent Space精选AI 评分8585 Xiaomi MiMo-V2.6-Pro 1T-A42B 发布,以约 300 万美元训练成本登顶开源权重模型
Latent Space 期 AINews 汇总,Xiaomi 发布 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash 原生全模态开源模型(MIT 许可)。
推荐理由:原文汇总了 MiMo-V2.6-Pro 登顶开源权重榜的评测数据和 RL 训练成本细节,读者可以借此评估后训练路线的实际性价比。
elsewhere articles精选AI 评分6565 Step 5 Preview 实测:榜单之外的真实表现与短板
阶跃毫无预兆发布 Step 5 Preview,总参数量 600B、激活 27B,带视觉输入,称 Artificial Analysis 上涨 44 分、全球开源前三,单任务成本仅为 Claude Opus 5 的 1/8。
推荐理由:作者与朋友实测了 Step 5 Preview 在可视化、金融、游戏等任务上的真实表现,补上了榜单分数之外的第一手体感参考。
OpenRouter Announcements精选AI 评分6161 OpenRouter 解析 NVIDIA Nemotron 3.5 Lightning 如何承担智能体高频执行调用
OpenRouter 发文解析 NVIDIA 的 Nemotron 3.5 Lightning,这是一个 30B 总参数、每 token 激活约 3B 的 MoE 开源权重模型,定位于智能体工作流中的高频执行步骤。
推荐理由:原文梳理了模型规格、与 Ultra 的分工、各端点差异和路由方法,可帮助读者判断何时用它替代大模型执行高频调用。
Claude Platform release notes精选AI 评分8282 Anthropic 发布 Claude Opus 5.5,默认 1M 上下文并降低价格
Anthropic 发布 Claude Opus 5.5(claude-opus-5-5),面向长时运行的智能体编码与知识工作,默认 1M token 上下文窗口。
推荐理由:官方发布说明列出了价格、上下文窗口和 API 行为变化,可为长期智能体编码工作流的迁移提供具体参考。
Google DeepMind精选AI 评分7171 Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型
Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 两个实时语音对话模型,主打近实时推理与语音智能体。
推荐理由:官方给出两个新语音模型的定位分工和多项基准数字,读者可据此判断其适合规模化还是高复杂度语音任务。
inclusionAI Hugging Face modelsAI 评分5353 inclusionAI 发布 MoE 块扩散视觉语言 GUI Agent 模型 LLaDA-UI
inclusionAI 在 Hugging Face 开源 LLaDA-UI,一个基于 MoE 的块扩散视觉语言 GUI Agent,总参数约 16.7B,语言骨干为 LLaDA2.0-mini-base。
SiliconFlow@SiliconFlowAIAI 评分5252
AI at Meta@AIatMetaAI 评分4848Muse Spark 1.3 现已支持 max reasoning,可在 Muse Code 和 Meta Model API 上使用 👇
引用Alexandr Wang@alexandr_wang1/ we just publicly released Muse Spark 1.3 max! we see significantly stronger coding and agentic performance on muse spark 1.3 max, so would strongly recommend trying it out even if you've already tried muse spark 1.3 high or muse spark 1.3 xhigh.

