最新精选 第 241–260 条 · 共 575 条 13:43 xAI 发布 AI 助手 Grok,其底层是自研前沿 LLM Grok-1,Grok 通过 𝕏 平台具备对世界的实时知识。Grok-1 在 HumanEval 上取得 63.2%、MMLU 73%、GSM8k 62.9%、MATH 23.9%,xAI 称其在该算力级别中超过 ChatGPT-3.5 和 Inflection-1,仅落后于训练数据和算力大得多的 GPT-4。
推荐理由:原文给出 Grok-1 在 HumanEval、MMLU 等基准上的分数与同算力级别的横向对比,可据此判断其能力定位。
13:43 xAI 发布 Grok 4.6,在 Grok 4.5 基础上强化长时间运行的智能体以及更复杂的交互与视觉任务,官方称其在多项智能体编码和知识工作基准上达到前沿水平。
推荐理由:官方列出 Grok 4.6 在多项智能体编码与知识工作基准上的对比数据,可据此判断其在长任务上的位置。
13:43 xAI 以 Apache 2.0 许可开放 Grok-1 的基座模型权重和网络架构。Grok-1 是 314B 参数的 Mixture-of-Experts 模型,每个 token 激活 25% 的权重,由 xAI 使用基于 JAX 和 Rust 的自研训练栈从零训练,预训练阶段于 2023 年 10 月结束。
推荐理由:xAI 以 Apache 2.0 开放 314B MoE 基座权重与架构,读者可据此了解其预训练配置和复用条件。
13:43 xAI 发布 Grok-2 与 Grok-2 mini 的早期预览版,称它们在聊天、编码和推理上较 Grok-1.5 有显著提升。早期版本以 sus-column-r 名义在 LMSYS 榜单测试,xAI 称其整体 Elo 超过 Claude 3.5 Sonnet 和 GPT-4-Turbo。
推荐理由:原文给出 Grok-2 与 Grok-2 mini 的完整基准表和竞技场排名,可与 Claude、GPT-4o 等模型直接对照。
13:43 xAI 发布 Grok-1.5 模型,具备长上下文理解与高级推理能力,将在未来几天面向早期测试者和 𝕏 平台现有 Grok 用户开放。Grok-1.5 在 MATH 得 50.6%、GSM8K 得 90%、HumanEval 得 74.1%,相比 Grok-1 的 23.9%、62.9% 和 63.2% 均有提升。
推荐理由:原文给出 Grok-1.5 的数学、编码基准成绩与 128K 上下文窗口,读者可据此对比同期模型的推理能力。
13:43 xAI 发布代号 Aurora 的图像生成模型,随 Grok Imagine API 一同上线,覆盖图像生成、图像编辑以及视频生成与视频编辑。Aurora 是自回归 MoE 网络,通过预测交错文本与图像数据中的下一个 token 训练,使用数十亿互联网样本,原生支持多模态输入并可直接编辑用户提供的图片。新能力已在 𝕏 平台面向部分国家开放,并将在约一周内推送给全部用户。
推荐理由:官方给出 Aurora 的架构思路与多模态输入能力,可据此判断 Grok 图像生成在文本渲染与图像编辑上的定位。
13:43 xAI 发布 Grok 4 与 Grok 4 Heavy,用 20 万 GPU 集群 Colossus 把强化学习训练扩展到预训练规模,训练算力效率提升 6 倍。
推荐理由:原文给出强化学习规模化的训练细节与多项基准成绩,可了解 Grok 4 的推理与工具调用取向。
13:43 xAI 将 Imagine Image 2.0 作为 grok.com/imagine 以及 iOS、Android 应用的新 Quality Mode 正式开放,并在 API 中以 grok-imagine-image-2.0 提供。
推荐理由:官方给出图像生成与编辑榜单排名及局部编辑、多参考图等能力,读者可判断它能否接入现有设计流程。
13:43 xAI 宣布开始向 X 平台所有用户免费推送新版 Grok-2,该版本速度提升三倍,在准确率、指令遵循和多语言能力上有所改进,Premium 与 Premium+ 用户仍享有更高使用额度。
推荐理由:官方给出新版 Grok-2 的速度、能力改进与 API 定价,可对照此前 Grok-2 的开放范围与使用成本。
13:43 xAI 发布旗舰语音模型 grok-voice-think-fast-1.0,主打复杂多轮语音工作流、低响应延迟与高并发工具调用,可在客服、电话销售和企业场景中部署。
推荐理由:在发布新语音模型的同时给出 τ-voice Bench 排名和 Starlink 客服销售的实际部署数字,便于对照同类语音智能体。
13:43 xAI 发布新一代语音模型 Grok Voice Think Fast 2.0,称其在语音推理、转录准确率和对话能力上较 1.0 有明显提升。该模型在 Artificial Analysis 语音到语音质量指数上为 82.9%,首字延迟 0.70s,转录准确率相对 Deepgram Nova 3 与 ElevenLabs Scribe v2 提升 1.5–2.0 倍。
推荐理由:相比 1.0 与 GPT-Realtime-2.1,原文给出了语音质量、推理效率与首字延迟的对比数据,可供语音智能体选型参考。
13:43 Mistral 发布开源模型 Mixtral 8x22B,采用稀疏 Mixture-of-Experts 架构,141B 总参数中仅激活 39B,并以 Apache 2.0 许可开放。
推荐理由:原文给出与主流开源模型在多语言、数学和编码基准上的对比,可用于评估同等推理预算下的性能取舍。
13:43 Mistral 发布 22B 参数的 Mistral Small v24.09,同时上线 la Plateforme 免费层并对全系模型降价。Mistral Small 与 Codestral 的输入输出价格均降 80%,Mistral Nemo 降 50%,Mistral Large 降 33%,更新后 Mistral Large 2 被称最具成本效益的前沿模型。
推荐理由:原文列出各模型具体降价幅度与免费层入口,读者可据此评估调用成本与自部署条件。
13:43 Mistral AI 发布首个模型 Mistral 7B,采用 Apache 2.0 许可,称其在所有标准英文与代码基准上超过现有 13B 参数以下的开放模型。
推荐理由:官方在发布开源模型的同时给出路线图,并对比两年间 MMLU 60% 门槛上最小模型的参数变化。
13:43 Mistral AI 发布 Mistral Large 2,具备 128k 上下文窗口和 1230 亿参数,针对长上下文应用设计,可在单节点上实现大吞吐推理。官方称其预训练版本在 MMLU 上达到 84.0% 准确率,代码与推理表现与 GPT-4o、Claude 3 Opus、Llama 3 405B 处于同一水平。
推荐理由:原文给出 128k 上下文、123B 参数与单节点部署的设定,读者可据此判断这一代模型在性能与成本之间的取舍。
13:43 Mistral AI 发布 Pixtral 12B 原生多模态模型,基于 Mistral Nemo 12B,采用 Apache 2.0 许可,支持可变图像尺寸与宽高比,并可在 128k token 上下文内处理任意数量图片。
推荐理由:Pixtral 12B 以 Apache 2.0 开源并支持 128k 多图输入,MMMU 得分 52.5%,读者可据此比较小尺寸多模态模型的取舍。
13:43 Mistral 与 NVIDIA 合作发布 12B 模型 Mistral NeMo,支持最多 128k token 上下文,基座与指令微调权重均以 Apache 2.0 许可开源。
推荐理由:Mistral NeMo 以 Apache 2.0 开源并支持 128k 上下文,读者可借基准表判断它与同尺寸开源模型的位置。
13:43 Mistral AI 发布新一代旗舰文本生成模型 Mistral Large,可通过 la Plateforme 和 Azure 使用,具备 32K token 上下文窗口与原生函数调用能力。
推荐理由:官方给出与 GPT-4 的基准位次和 Azure 上线渠道,读者可据此了解这款欧洲旗舰模型的定位。
13:43 Mistral 发布 Codestral Mamba,这是一个基于 Mamba 架构的 7B 指令代码模型,权重已在 HuggingFace 开放,采用 Apache 2.0 许可。
推荐理由:Mamba 架构带来线性时间推理与长序列建模,官方还测试了 256k token 的上下文检索,为代码助手的本地部署提供 Transformer 之外的选择。
13:43 Mistral AI 发布 24B 参数的 Mistral Small 3,以 Apache 2.0 许可同时放出预训练和指令微调 checkpoint。官方称其指令版与 Llama 3.3 70B instruct 相当,同硬件下速度超过 3 倍,MMLU 准确率超 81%,延迟 150 tokens/s。
推荐理由:官方给出了 24B 模型的对标结果与本地部署门槛,读者可据此判断它在开源替代中的位置。
上一页 1 … 11 12 13 14 15 … 29 下一页