跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

当前仅显示精选新闻
530条精选相关主题产品更新论文研究开源生态

最新精选

第 1–20 条 · 共 530 条
今天10月6日周二
  1. Rohan Paul65

    Reflection AI 发布开源智能体模型 Beam,总参数 501B、激活 23B,宣称在编码和智能体任务上推进西方开源前沿,完整权重将于本月以 Apache 2.0 发布并附带 FP8 和 NVFP4 版本。

    引用Reflection@reflection_ai

    Introducing Beam: a highly efficient agentic open model with 501B total parameters and 23B active. - Frontier reasoning efficiency - Advances the Western open frontier on coding & agentic tasks - Trained end-to-end from scratch Full weights release this month. Learn more about Beam: http://reflection.ai/beam

    推荐理由:作者在转发基础上补充了效率估算口径和 headline 图表外的对比数据,帮助读者更冷静地看待 Beam 对 GLM-5.2 的领先说法。

10月3日周六
  1. 硅星人Pro · 微信公众号65

    Tavus 发布实时视频交互模型 Griffin,48% 参与者把预览版当成真人

    Tavus 发布实时视频交互模型 Griffin,在54人一分钟视频通话实验中,26人(约48%)把预览版 Griffin-Lite 当成真人,上一代系统该比例为 2.4%。模型采用全双工视频交互方案,可同时看听说并依据表情、视线和停顿回应,音频到视频生成平均延迟 0.43 秒,实时生成 720p、25 帧每秒画面;目前仅向部分可信测试者开放研究预览,团队正开发 AI 身份披露功能。

    推荐理由:原文同时给出48%的实验数字和延迟、榜单成绩,读者可以据此自行判断这轮视频交互能力的边界。

10月2日周五
  1. Microsoft AI News61

    Microsoft AI 发布 MAI-Transcribe-2-Streaming 及 MAI-Voice-2.1 语音模型

    Microsoft AI 发布实时流式转写模型 MAI-Transcribe-2-Streaming,在 Artificial Analysis 的最终与部分转写准确率均排名第一,支持 60 种语言,接收到音频后约 100ms 内产出首个 partials,内部评测显示实时听写场景出词速度比最接近的竞品快 2x,年底前 introductory 价 $0.54 每小时音频。

    推荐理由:官方公布三款语音模型的具体定价、延迟数字和 Artificial Analysis 排名,可据此评估搭建语音智能体的成本与速度。

10月1日周四
  1. AGI Hunt · 微信公众号80

    谷歌 DeepMind 发布 Gemini 4 Argon,单次输出达 100 万 token 但编程偏科

    谷歌 DeepMind 发布新旗舰模型 Gemini 4 Argon,未带 Pro、Flash 后缀,单次输出上限从上一代 64K 提升到 100 万 token,介绍价每百万 token 输入 $2、输出 $10。

    推荐理由:作者汇总了官方跑分、第三方榜单和彭博社爆料,读者可以对照看到 Argon 各项能力的强项与短板。

  2. DeepTech深科技 · 微信公众号76

    Google 发布 Gemini 4 首款旗舰模型 Argon,18 项评测领先 12 项,先开放给网络安全团队

    Google 于当地时间 9 月 30 日发布 Gemini 4 系列首款旗舰模型 Argon,暂不面向普通用户,先通过 Fairwind 项目开放给受信任的网络安全防御机构。

    推荐理由:文章汇总了 Gemini 4 Argon 的基准成绩、定价和分阶段开放策略,并指出其在部分基准上仍有落后,便于比较各家旗舰模型差距。

  3. AI寒武纪 · 微信公众号77

    谷歌发布Gemini 4 Argon,单次输出上限提升至100万Token

    谷歌发布Gemini 4 Argon,单次输出Token上限从64K提升到100万。模型在DeepSWE v1.1取得77.9%的SOTA成绩,AutomationBench拿下51.3%头名,但Terminal-bench4.0仍落后。Argon百万输入Token收费2美元、输出10美元,目前通过Fairwind计划向受信任的网安人员开放,并参与美国政府发布前审查。

    推荐理由:文章汇总了模型能力、价格与内部落地数据,读者可以据此评估它在软件工程和网安场景的适用性。

  4. The Decoder79

    Google 发布 Gemini 4 Argon,追赶 OpenAI 与 Anthropic 但未取得明确领先

    Google 发布新旗舰模型 Gemini 4 Argon,是其七个多月来首款前沿模型,Artificial Analysis 测试中得 53 分,与 GPT-6 Astra (max)、Claude Fable 5.1 持平,但仍落后 Claude Opus 5.5 的 58 分。

    推荐理由:原文汇总了第三方测试与定价细节,指出 Gemini 4 Argon 缩小差距但未领先,且单价优势来自低 token 价格而非效率。

  5. AI前线 · 微信公众号75

    谷歌发布 Gemini 4 Argon,输出上限提升至百万 Token 并优先开放网络安全防御

    谷歌发布新一代模型 Gemini 4 Argon,输出 Token 上限从 64K 提升至 100 万,在 DeepSWE v1.1 取得 77.9%、LVBench 得分 91.7%、AutomationBench 以 51.3% 排名第一。

    推荐理由:文章汇总了模型跑分、内部工程案例和先向受信任团队开放的分阶段发布策略,能帮助读者了解能力之外的开放节奏问题。

  6. InfoQ · 微信公众号71

    Google 发布 Gemini 4 Argon:输出上限提升至百万 Token,已参与 80 万行内核代码迁移

    Google 发布新一代模型 Gemini 4 Argon,面向长流程软件工程、企业知识工作与网络安全防御,输出 Token 上限从 64K 提升至 100 万,初期每百万输入 Token 2 美元、输出 10 美元。

    推荐理由:梳理了 Gemini 4 Argon 的跑分、定价与分阶段开放节奏,读者可以据此评估其能力与实际可用性之间的距离。

  7. Demis Hassabis66

    Google DeepMind 推出蛋白质水印方法 SynthID Bio,成功合成既有功能又带水印的 AI 设计蛋白质,成果发表于 Nature。作者称生物安全是 AI 时代最紧迫挑战之一,并开源 SynthID Bio 工具供研究社区使用。

    引用Pushmeet Kohli@pushmeet

    Very happy to announce that our team @GoogleDeepmind has pushed the boundaries of generative biology, achieving the successful synthesis of AI-designed proteins that are both functional and watermarked. This proof-of-concept watermarking of the building blocks of life is enabled by SynthID Bio, our new protein watermarking method. It is designed to safeguard the new era of AI-powered generative biology and strengthen global biosecurity. You can read my thoughts here on why watermarking AI-designed proteins is an important research breakthrough: https://x.com/pushmeet/status/2105314763148321102

    推荐理由:AI 设计蛋白质首次实现功能与水印兼具并发表于 Nature,同时开源工具,读者可关注生物安全水印路线的实际落地。

9月30日周三
9月29日周二
  1. OpenAI News70

    OpenAI 发布 GPT-6.1 Sol,以 Astra 五分之一的价格提供近 Astra 智能水平

    OpenAI 发布 GPT-6.1 Sol,定位为接近 Astra 智能水平的模型,主打编码、计算机使用和专业工作场景,价格为 Astra 标准 API 输入和输出 token 价格的五分之一。

    推荐理由:原文明确了模型定位与五分之一的价格对比,读者可以据此评估在不同工作负载下替换现有模型API的成本空间。