

推荐理由:1.8B 翻译模型量化到 1.25bit 后仅 440MB,可在手机离线运行,为端侧模型压缩提供参考。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。


推荐理由:1.8B 翻译模型量化到 1.25bit 后仅 440MB,可在手机离线运行,为端侧模型压缩提供参考。
NVIDIA 发布开源全能多模态理解模型 Nemotron 3 Nano Omni 30B-A3B,在 OCRBenchV2-En 得分 65.8、MMLongBench-Doc 57.5,并新增音频与视频理解能力。
推荐理由:原文列出文档、视频与音频榜单成绩及吞吐对比,读者可据此判断该开源全能模型的能力边界。
inclusionAI 开源发布 Ling-2.6-flash,这是一个总参数 104B、激活参数 7.4B 的指令模型,面向高频智能体场景优化推理效率与 token 效率。
推荐理由:官方给出 104B 总参数与 7.4B 激活参数的具体配置和评测数据,可用于评估高频智能体场景下的推理成本与部署取舍。
inclusionAI 在 Hugging Face 开源 Ling-2.6-flash 指令模型,总参数 104B、激活参数 7.4B,主打推理效率与 token 效率。
推荐理由:模型以 7.4B 激活参数和混合线性架构给出推理吞吐与 token 效率数据,可供评估高并发 agent 场景的部署成本。
inclusionAI 在 Hugging Face 发布 DR-Venus-4B-SFT-GGUF,这是由 Qwen/Qwen3-4B-Thinking-2507 微调而来的 4B 深度研究智能体,也是 DR-Venus 的监督初始化检查点。
推荐理由:用约 1 万条开放轨迹训练出 4B 深度研究智能体,并在多个基准上超过此前同规模开源模型。
inclusionAI 发布 4B 深度研究智能体 DR-Venus-4B-SFT,基于 Qwen3-4B-Thinking-2507 在清洗后的开源 REDSearcher 轨迹上做智能体监督微调,最大训练长度 200K,使用 search 与 visit 工具。
推荐理由:给出 9B 以下开源深研究智能体的基准对比,读者可据此判断 4B 模型的深研究能力位置。
DeepSeek V4 发布,包含 Flash 和 Pro 两个型号,支持 JSON 输出、工具调用、对话前缀续写和 FIM 补全。Flash 每百万输入/输出价格为 ¥0.2 和 ¥1,Pro 为 ¥1 和 ¥12,100 万上下文的输出价格翻倍,详情见 api-docs.deepseek.com/zh-cn/quick_start/pricing。
推荐理由:原文汇总了两个型号的功能支持与每百万输入输出价格,读者可据此对比选型和使用成本。
深度求索上线并开源全新系列模型 DeepSeek-V4 预览版,按大小分为 V4-Pro 与 V4-Flash 两个版本,1M(一百万)上下文成为其所有官方服务标配。
推荐理由:DeepSeek-V4 预览版把 1M 上下文设为官方服务标配,并同步开源 Pro 与 Flash 两个版本。
DeepSeek 发布 V4,Hub 上提供两个 MoE 检查点:DeepSeek-V4-Pro 总参数 1.6T、激活 49B,DeepSeek-V4-Flash 总参数 284B、激活 13B,两者均支持 1M token 上下文窗口。
推荐理由:原文拆解了 V4 面向长上下文智能体的注意力与后训练设计,可据此判断开源模型跑长任务时的成本变化。
The new Hy3-Preview model from @TencentHunyuan is live for free on OpenRouter! It’s a 295B MoE model (21B active) with controllable reasoning effort. A cost-effective, practical model that performs strongly in coding agents and delivers comprehensive general capabilities.
推荐理由:腾讯混元 Hy3-Preview 上线 OpenRouter 并限时免费,读者可了解其 MoE 规模与可控推理强度设定。
DeepSeek API 已支持 V4-Pro 与 V4-Flash,兼容 OpenAI ChatCompletions 接口与 Anthropic 接口,base_url 不变,model 参数改为 deepseek-v4-pro 或 deepseek-v4-flash。
推荐理由:官方说明了新模型接入方式与旧模型名停用时间,开发者可以据此安排迁移。
OpenAI 发布 GPT-5.5,这是一款面向编码、研究和数据分析等复杂任务的模型。该模型强调跨工具处理这些任务。
推荐理由:OpenAI 发布 GPT-5.5,面向编码、研究和数据分析等复杂任务,读者可了解其跨工具能力定位。
OpenAI 发布 GPT-5.5 系统卡,介绍该模型面向写代码、在线研究、分析信息、创建文档与表格等复杂实际工作,并能跨工具完成任务。系统卡披露了预部署安全评估和 Preparedness Framework 下的针对性红队测试,覆盖高级网络安全与生物能力,并在发布前收集了近 200 家早期访问伙伴的反馈。
推荐理由:系统卡列出 GPT-5.5 的预部署安全评估、针对性红队测试和近 200 家早期访问伙伴的反馈,读者可据此了解其发布前的安全审查流程。
Anthropic 发布 Claude Opus 4.7,定位复杂推理与智能体编码,定价维持 $5/$25 per MTok,与 Opus 4.6 相比存在 API 破坏性变更并需参考迁移指南。
推荐理由:原文列出定价、API 破坏性变更、task budgets 与高分辨率图像等具体变化,升级前可据此排查迁移成本。
Google DeepMind 发布 Gemini Robotics-ER 1.6,提升机器人在空间推理、多视角理解、任务规划和成功检测方面的能力,并新增仪表读数功能。
推荐理由:官方给出了与上一代的具体能力对比和仪表读数新用例,读者可据此评估其是否适配现有机器人方案。
Microsoft AI 宣布发布 MAI-Transcribe-1、MAI-Voice-1 和 MAI-Image-2 三款模型,现已在 Microsoft Foundry 和 MAI Playground 开放。
推荐理由:官方公布三款 MAI 模型的 Foundry 定价与基准对比,开发者可直接据此评估接入成本和可用性。
Mistral AI 发布 4B 参数的文本转语音模型 Voxtral TTS,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,API 定价 $0.016 per 1k characters。
推荐理由:官方给出了与 ElevenLabs 对比的人类评测数据和低延迟指标,读者可据此评估其在语音 Agent 场景的可用性。
Microsoft AI 团队发布图像生成模型 MAI-Image-2,称其使 MAI 进入 Arena.ai 榜单前三的文生图实验室行列。
推荐理由:原文给出榜单排名、可用入口和面向创意工作的三大能力重点,读者可据此判断是否试用或接入。
Mistral 发布 Mistral Small 4,将 Magistral 的推理、Pixtral 的多模态与 Devstral 的智能体编码能力统一到单一开源模型,采用 Apache 2.0 许可证。
推荐理由:官方公布了架构参数、reasoning_effort 用法和与 GPT-OSS 120B 的效率对比,可据此评估其开源部署价值。
Mistral 发布 Voxtral Transcribe 2 系列,包含 Voxtral Mini Transcribe V2(批量转写)和 Voxtral Realtime(实时转写),支持 13 种语言的说话人分离、上下文偏置和词级时间戳。
推荐理由:官方给出了两个语音转写模型的具体延迟、错误率和价格,并开放了 Voxtral Realtime 权重,便于按场景选型。