最新精选 第 101–120 条 · 共 212 条 00:52 Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型发布 DSpark 草稿模型 checkpoint,通过投机解码在不改变输出质量的前提下加速推理,GPU 吞吐最高提升 3.18x,端侧最高 2.87x。
推荐理由:官方为 LFM2.5 三款模型发布 DSpark 草稿模型,给出从 H100 到 MacBook 的实测加速数据和开源接入方式。
19:03 Stripe 收购 OpenRouter,交易金额超过 70 亿美元,早期谈判价曾达 100 亿美元,消息由 Bloomberg 报道。
推荐理由:交易把模型路由与支付计量并入同一闭环,读者可借此理解 AI 推理支出入口为何被高价收购。
13:43 xAI 发布 Grok 4 Fast,称其用平均少 40% 的思考 token 在基准上达到与 Grok 4 相当的表现,同一前沿基准性能的价格降低 98%。该模型采用统一架构,由系统提示词切换长链推理与快速响应,具备 2M token 上下文窗口和端到端训练的工具调用与网络、X 搜索能力,在 LMArena Search Arena 以 1163 Elo 排名第一。
推荐理由:原文给出与 Grok 4 的基准对比、token 消耗和 API 定价,读者可据此判断推理模型的成本效率走向。
13:43 xAI 发布 Grok 4.1,已在 grok.com、X 及 iOS 和 Android 应用向所有用户开放,Auto 模式即时上线并可在模型选择器中显式选择。
推荐理由:官方给出与上一代在真实流量中的盲测偏好和 LMArena 榜单对比,可据此判断对话风格与幻觉控制的改进幅度。
13:43 xAI 发布 AI 助手 Grok,其底层是自研前沿 LLM Grok-1,Grok 通过 𝕏 平台具备对世界的实时知识。Grok-1 在 HumanEval 上取得 63.2%、MMLU 73%、GSM8k 62.9%、MATH 23.9%,xAI 称其在该算力级别中超过 ChatGPT-3.5 和 Inflection-1,仅落后于训练数据和算力大得多的 GPT-4。
推荐理由:原文给出 Grok-1 在 HumanEval、MMLU 等基准上的分数与同算力级别的横向对比,可据此判断其能力定位。
13:43 xAI 发布 Grok-2 与 Grok-2 mini 的早期预览版,称它们在聊天、编码和推理上较 Grok-1.5 有显著提升。早期版本以 sus-column-r 名义在 LMSYS 榜单测试,xAI 称其整体 Elo 超过 Claude 3.5 Sonnet 和 GPT-4-Turbo。
推荐理由:原文给出 Grok-2 与 Grok-2 mini 的完整基准表和竞技场排名,可与 Claude、GPT-4o 等模型直接对照。
13:43 xAI 发布 Grok-1.5 模型,具备长上下文理解与高级推理能力,将在未来几天面向早期测试者和 𝕏 平台现有 Grok 用户开放。Grok-1.5 在 MATH 得 50.6%、GSM8K 得 90%、HumanEval 得 74.1%,相比 Grok-1 的 23.9%、62.9% 和 63.2% 均有提升。
推荐理由:原文给出 Grok-1.5 的数学、编码基准成绩与 128K 上下文窗口,读者可据此对比同期模型的推理能力。
13:43 xAI 发布 Grok 4 与 Grok 4 Heavy,用 20 万 GPU 集群 Colossus 把强化学习训练扩展到预训练规模,训练算力效率提升 6 倍。
推荐理由:原文给出强化学习规模化的训练细节与多项基准成绩,可了解 Grok 4 的推理与工具调用取向。
13:43 xAI 发布新一代语音模型 Grok Voice Think Fast 2.0,称其在语音推理、转录准确率和对话能力上较 1.0 有明显提升。该模型在 Artificial Analysis 语音到语音质量指数上为 82.9%,首字延迟 0.70s,转录准确率相对 Deepgram Nova 3 与 ElevenLabs Scribe v2 提升 1.5–2.0 倍。
推荐理由:相比 1.0 与 GPT-Realtime-2.1,原文给出了语音质量、推理效率与首字延迟的对比数据,可供语音智能体选型参考。
13:43 Mistral 发布开源模型 Mixtral 8x22B,采用稀疏 Mixture-of-Experts 架构,141B 总参数中仅激活 39B,并以 Apache 2.0 许可开放。
推荐理由:原文给出与主流开源模型在多语言、数学和编码基准上的对比,可用于评估同等推理预算下的性能取舍。
13:43 Mistral 发布 22B 参数的 Mistral Small v24.09,同时上线 la Plateforme 免费层并对全系模型降价。Mistral Small 与 Codestral 的输入输出价格均降 80%,Mistral Nemo 降 50%,Mistral Large 降 33%,更新后 Mistral Large 2 被称最具成本效益的前沿模型。
推荐理由:原文列出各模型具体降价幅度与免费层入口,读者可据此评估调用成本与自部署条件。
13:43 Mistral AI 发布 Mistral Large 2,具备 128k 上下文窗口和 1230 亿参数,针对长上下文应用设计,可在单节点上实现大吞吐推理。官方称其预训练版本在 MMLU 上达到 84.0% 准确率,代码与推理表现与 GPT-4o、Claude 3 Opus、Llama 3 405B 处于同一水平。
推荐理由:原文给出 128k 上下文、123B 参数与单节点部署的设定,读者可据此判断这一代模型在性能与成本之间的取舍。
13:43 Mistral 与 NVIDIA 合作发布 12B 模型 Mistral NeMo,支持最多 128k token 上下文,基座与指令微调权重均以 Apache 2.0 许可开源。
推荐理由:Mistral NeMo 以 Apache 2.0 开源并支持 128k 上下文,读者可借基准表判断它与同尺寸开源模型的位置。
13:43 Mistral AI 发布新一代旗舰文本生成模型 Mistral Large,可通过 la Plateforme 和 Azure 使用,具备 32K token 上下文窗口与原生函数调用能力。
推荐理由:官方给出与 GPT-4 的基准位次和 Azure 上线渠道,读者可据此了解这款欧洲旗舰模型的定位。
13:43 Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可的稀疏混合专家(SMoE)开放权重模型,总参数 46.7B,每个 token 只激活 12.9B 参数。
推荐理由:官方给出与 Llama 2 70B、GPT-3.5 的逐项基准对比,可据此判断稀疏 MoE 开放权重的性价比。
13:43 Mistral AI 发布 7.3B 参数的 Mistral 7B,称其在全部评测上超过 Llama 2 13B,多项基准接近 Llama 1 34B。该模型采用分组查询注意力(GQA)和滑动窗口注意力(SWA),在 16k 序列长度、4k 窗口下推理提速 2x,并能在 8192 序列长度下节省一半缓存。
推荐理由:官方给出与 Llama 2 系列同评估管线的对比和 Apache 2.0 授权,便于判断同尺寸模型的选型空间。
22:30 Anthropic 发布新论文,称 Claude 在训练中自发形成了一小簇内部神经模式,命名为 J-space,其作用类似神经科学中的全局工作空间,承载模型没有说出口的内部想法。
推荐理由:论文给出了读取模型未说出口内部表征的方法,并演示干预这些表征如何改变推理与安全表现。
22:30 Anthropic 发布 Claude Sonnet 5,称其为最具智能体能力的 Sonnet 模型,即日起成为 Free 和 Pro 套餐默认模型,Max、Team、Enterprise 用户也可使用,定价为每百万输入 token 2 美元、每百万输出 token 10 美元。
推荐理由:Anthropic 官方给出 Sonnet 5 与 Sonnet 4.6、Opus 4.8 的对比数据,读者可据此判断同级模型的智能体能力与成本差距。
22:30 Anthropic 发布 Claude Opus 5,在 Frontier-Bench、GDPval-AA 等编码与知识工作评测上达到领先水平,定价与 Opus 4.8 相同,为每百万输入 token 5 美元、输出 25 美元。
推荐理由:官方给出 Opus 5 在编码与知识工作基准上的位置和定价,可对照前代 Opus 4.8 判断性能与成本的取舍。
上一页 1 … 4 5 6 7 8 … 11 下一页