跳到正文

#Agent

今日 5 条
今天10月2日周五
  1. TechCrunch · AI56

    AWS 发布开源决策模型 Strands Decider 2B,基于 Qwen3.5-2B

    AWS 发布开源决策模型 Strands Decider 2B,灵感来自 TypeSafe 的 Jev,可在预设选项间高速低成本地做选择并给出置信度。模型完全开源、可本地运行,由 Amazon 杰出工程师 Marc Brooker 的内部项目改进而来,基于 Qwen3.5-2B 的架构但不生成文本,而是输出校准后的选择,同一周 OpenAI 也宣布了类似产品。

10月1日周四
  1. The Decoder79

    Google 发布 Gemini 4 Argon,追赶 OpenAI 与 Anthropic 但未取得明确领先

    Google 发布新旗舰模型 Gemini 4 Argon,是其七个多月来首款前沿模型,Artificial Analysis 测试中得 53 分,与 GPT-6 Astra (max)、Claude Fable 5.1 持平,但仍落后 Claude Opus 5.5 的 58 分。

    推荐理由:原文汇总了第三方测试与定价细节,指出 Gemini 4 Argon 缩小差距但未领先,且单价优势来自低 token 价格而非效率。

  2. Karina52

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,面向编码、企业知识工作和网络安全防御等复杂工作流,即日起通过 Fairwind Program 向部分受信任测试者开放。作者引述其 PostTrainBench 得分 45.3%,高于 Gemini 3.1 Pro 的 21.99% 和 GPT-6 Astra 的 44.3%;评测表还显示其在自动化与智能体编码等多项基准领先,但在 FrontierSWE v2、Terminal-Bench 4.0 等项落后于对比模型。

    引用Google DeepMind@GoogleDeepMind

    Introducing Gemini 4 Argon – our new frontier model. It’s built for complex workflows across coding, enterprise knowledge work, and cybersecurity defense – rolling out today to a set of trusted testers through our Fairwind Program.

9月30日周三
  1. Qwen37

    Qwen3.8-27B 现已通过 @nebiustf 开放使用。无论你是在构建智能体还是做深度研究,这个 27B 稠密模型都已为你的多步骤工作流准备就绪!🥳

    引用Nebius Token Factory@nebiustf

    Qwen3.8-27B is now live on Nebius Token Factory. A compact 27B dense model for coding, research, and agent workflows, with a focus on planning and completing tasks across multiple steps. Start building: https://tokenfactory.nebius.com/endpoints?modals=endpoint-details&model-id=Qwen/Qwen3.8-27B

9月29日周二
  1. Microsoft Research61

    Microsoft Research 发布生物研究领域 AI 系统 Quine

    Microsoft Research 推出 Quine,一个面向生物学的多模态世界模型与交互式 harness,连接科学工具、文献和研究人员。在与 Broad Institute 合作中,Quine 用于预测可驱动胰腺癌肿瘤细胞状态转变的化合物,排名第一的候选化合物在湿实验中产生了最大的预期细胞状态转变,从缩小化合物范围到确定候选名单仅用了一个周末。

    推荐理由:官方披露了系统构成和胰腺癌湿实验验证结果,读者可以据此评估AI世界模型在生物研究中的实际作用。

9月28日周一
  1. Hugging Face Blog75

    H Company 发布 Holo4 系列通用计算机操作智能体模型

    H Company 发布 Holo4 智能体模型系列,包含 27B dense 和 35B-A3B MoE 两个尺寸,并附带基于 Nemotron 3 Nano Omni 后训练的 Holotron4 Nano。

    推荐理由:官方发布给出了跨 GUI、代码、MCP 和 API 四类接口的统一智能体模型,附基准分数和完整轨迹数据,适合评估开源方案与闭源模型的成本差距。

9月25日周五
  1. karminski-牙医59

    美团 LongCat 发布 LongCat-2.5-Preview 模型,总参数 1.6T、激活约 48B,支持 1M token 上下文窗口,原生多模态,面向终端、浏览器、GUI、表格和设计工具等长程任务。API 与聊天入口分别见 https://longcat.ai/platform/ 和 https://longcat.ai/chat/;作者补充定价与之前一样,图中显示输入(缓存未命中)2.00 元/百万 token,输入(缓存命中)0.04 元/百万 token,输出 8.00 元/百万 token。

    引用Meituan LongCat@Meituan_LongCat

    LongCat-2.5-Preview is now live. 1.6T parameters. ~48B active. A 1M-token context window. Natively multimodal. Built to take on long-horizon tasks. From terminals and browsers to GUIs, spreadsheets, and design tools. Try it now: 🚀 API: https://longcat.ai/platform/ 💬 Chat: https://longcat.ai/chat/

9月24日周四
  1. inclusionAI Hugging Face models62

    inclusionAI 开源 Ling-flash-2.0:100B 总参数、6.1B 激活的 MoE 模型

    inclusionAI 正式开源 Ling 2.0 架构下的第三个 MoE 大语言模型 Ling-flash-2.0,总参数 100B、激活参数 6.1B(非嵌入 4.8B),基于 20T+ tokens 数据训练并经 SFT 和多阶段强化学习。

    推荐理由:官方给出参数结构、基准对比和推理速度数据,读者可据此评估小激活 MoE 替代 40B 稠密模型的可行性。

  2. inclusionAI Hugging Face models62

    inclusionAI 开源万亿参数思考模型 Ring-2.5-1T

    inclusionAI 发布开源万亿参数思考模型 Ring-2.5-1T,采用 1:7 MLA + Lightning Linear Attention 混合线性注意力架构,激活参数从 51B 增至 63B。

    推荐理由:原文给出了混合线性注意力的具体效率数字和多项基准成绩,读者可以据此评估它在长程智能体场景中的实际取舍。

  3. inclusionAI Hugging Face models62

    inclusionAI 开源 Ling-2.5-1T:1T 总参数、63B 激活的即时模型,支持 1M 上下文

    inclusionAI 发布并开源 Ling-2.5-1T,总参数 1T、激活 63B,预训练语料扩至 29T tokens,经 YaRN 外推支持最长 1M tokens 上下文。

    推荐理由:官方模型卡给出架构、token 效率和长上下文评测细节,可帮助读者评估这款万亿参数即时模型对现有部署工作流的适配。

  4. inclusionAI Hugging Face models69

    inclusionAI 正式开源 Ling-2.6-flash:104B 总参数、7.4B 激活的混合线性 MoE 模型

    inclusionAI 正式开源 instruct 模型 Ling-2.6-flash,总参数 104B、激活 7.4B,采用 1:7 MLA + Lightning Linear 混合线性注意力与高稀疏 MoE 架构。

    推荐理由:官方给出架构细节、340 tokens/s 推理速度和 15M tokens 评测用量等数据,也坦承工具幻觉局限,读者可据此评估高频率 Agent 部署场景的适配度。

  5. inclusionAI Hugging Face models60

    inclusionAI 发布万亿参数推理模型 Ring-2.6-1T

    inclusionAI 发布万亿参数旗舰推理模型 Ring-2.6-1T,主打真实生产环境中的 Agent 执行与复杂推理,上下文长度由 128K 扩展到 256K(YaRN),采用 MIT License 开源。

    推荐理由:官方发布页给出 Agent 执行、推理档位和异步 RL 训练的具体做法与基准数字,读者可据此评估其在生产场景的适配价值。

9月23日周三
  1. Latent Space85

    Anthropic 发布 Claude Opus 5.5,OpenAI 同日跟进低价 GPT-6 Sol 与 Luna

    AINews 汇总 Claude Opus 5.5 发布:作为 Claude 5.5 家族首个模型,官方称多数任务达到 Fable 5.1 水平、比 Opus 5 快约 30% 且每任务便宜约 40%,token 单价从 $5/$25 降至 $4/$20,并成为 Claude Code 与 Claude 应用的新默认模型。

    推荐理由:汇总了 Opus 5.5 与 GPT-6 Sol/Luna 同日发布的基准、定价与第三方评测,含实际每任务成本与争议细节,便于对比两家宣传口径。

  2. Ant Ling46

    感谢 @ValsAI 的高水准评测!"flash"这个词现在有点"误导"了。Ling-3.0-flash-fin 总参数 124B、激活 5.1B,是一款高智能密度的"flash lite"。趁免费 API 还在,赶紧用起来。我们还有 fp4 量化版本可用于本地 AI 😛

    引用Vals AI@ValsAI

    Ant Group’s Ling 3.0 Flash Fin is a finance-specialized open-weight model that delivers strong financial analysis at budget-model pricing. On Finance Agent v2, it scores 54.9% at just $0.045 per task.

9月22日周二
  1. elsewhere articles65

    Step 5 Preview 实测:榜单之外的真实表现与短板

    阶跃毫无预兆发布 Step 5 Preview,总参数量 600B、激活 27B,带视觉输入,称 Artificial Analysis 上涨 44 分、全球开源前三,单任务成本仅为 Claude Opus 5 的 1/8。

    推荐理由:作者与朋友实测了 Step 5 Preview 在可视化、金融、游戏等任务上的真实表现,补上了榜单分数之外的第一手体感参考。

  2. OpenRouter Announcements61

    OpenRouter 解析 NVIDIA Nemotron 3.5 Lightning 如何承担智能体高频执行调用

    OpenRouter 发文解析 NVIDIA 的 Nemotron 3.5 Lightning,这是一个 30B 总参数、每 token 激活约 3B 的 MoE 开源权重模型,定位于智能体工作流中的高频执行步骤。

    推荐理由:原文梳理了模型规格、与 Ultra 的分工、各端点差异和路由方法,可帮助读者判断何时用它替代大模型执行高频调用。

9月16日周三
9月15日周二
9月5日周六
9月3日周四