跳到正文

#推理

今日 19 条
3月17日周二
3月11日周三
  1. LMSYS Blog61

    SGLang 支持 NVIDIA Nemotron 3 Super,面向高效多智能体系统

    SGLang 宣布 Day 0 支持 NVIDIA Nemotron 3 Super。该模型为 120B 参数混合 MoE,每次前向仅激活 12B 参数,采用混合 Transformer-Mamba 架构,支持 1M token 上下文、多 token 预测和思考预算,相比上一代 Nemotron Super 1.5 吞吐提升至 5 倍。

    推荐理由:原文给出模型架构、吞吐与准确率对比和 SGLang 部署命令,读者可以据此评估在多智能体工作流中的实际可用性。

2月20日周五
2月19日周四
1月30日周五
12月17日周三
  1. LMSYS Blog62

    LMSYS 发布 Mini-SGLang:5k 行代码的高性能 LLM 推理引擎

    LMSYS 推出源自 SGLang 的轻量级推理框架 Mini-SGLang,代码仅 5k 行 Python,保留 Radix Attention、Chunked Prefill、Overlap Scheduling、Tensor Parallelism 等核心优化,并提供 OpenAI 兼容 API 和开箱即用的 Llama-3、Qwen-3 支持。

    推荐理由:官方介绍这款仅 5k 行代码的推理引擎保留了哪些关键优化,以及如何用它学习和做研究原型。

12月3日周三
  1. Mistral AI77

    Mistral 发布 Mistral 3 系列模型,含 Mistral Large 3 与 Ministral 3,均以 Apache 2.0 开源

    Mistral 发布新一代模型系列 Mistral 3,包括 14B/8B/3B 的 Ministral 3 小模型和 sparse MoE 架构的 Mistral Large 3(41B 激活、675B 总参数),全部以 Apache 2.0 许可开源,提供 base、instruct 和 reasoning 变体。

    推荐理由:官方公布完整模型规格、开源许可和部署路径,读者可据此评估在自建或端侧场景的可用性。

12月1日周一
  1. DeepSeek API updates69

    DeepSeek-V3.2-Speciale 开放非正式 API 访问,截止 2025-12-15

    DeepSeek 非正式部署 DeepSeek-V3.2-Speciale API 服务,用户通过 base_url="https://api.deepseek.com/v3.2_speciale_expires_on_20251215" 访问。价格不变,仅支持思考模式下的对话功能,不支持工具调用,最大输出长度默认 128K,支持至北京时间 2025-12-15 23:59。

    推荐理由:原文给出了非正式部署的访问方式和明确截止时间,用户可以据此判断是否短期试用这个思考模式模型。

11月19日周三
  1. Mistral AI56

    Mistral AI 宣布在德国扩展业务并与 SAP、Helsing 达成合作

    Mistral AI 宣布通过多项长期战略承诺扩展在德国的业务。其中与 SAP 建立多年期合作,将 Mistral 模型集成到 SAP AI Foundation,为德国和欧洲提供完全主权 AI 堆栈并共同开发面向复杂行业和行政机构的行业解决方案;与 Helsing 加速开发面向国防和安全应用的视觉-语言-动作模型。Mistral 还计划大幅增加德国本地团队,并在未来几个月开设德国办公室。

9月29日周一
9月3日周三
8月21日周四
7月1日周二
  1. Microsoft AI News68

    Microsoft 发布 MAI-DxO,在 NEJM 病例序列诊断基准上正确率达 85%

    Microsoft AI 发布 MAI-DxO 诊断编排器与 SD Bench 基准,将 304 个 NEJM 病例转化为逐步诊断挑战,MAI-DxO 正确诊断最高达 85%,是同一组有经验医生的四倍以上,且以更低检查成本得出正确诊断。

    推荐理由:原文同时给出诊断准确率、成本对比和研究局限,并说明 SD Bench 尚未公开,读者可据此理解结果边界。

6月10日周二
5月28日周三
4月9日周三
3月24日周一
1月20日周一
12月19日周四
  1. AI as Normal Technology69

    AI 进步是否在放缓:Arvind Narayanan 等人解析模型扩展与推理扩展之争

    Arvind Narayanan、Benedikt Ströbl 和 Sayash Kapoor 撰文分析 OpenAI、Anthropic 和 Google Gemini 下一代模型遇阻后的叙事翻转,认为宣布模型扩展已死为时尚早,行业领袖的预测并不可靠。

    推荐理由:作者用可核查的证据指出业内叙事反复翻转的成因,并区分能力提升与实际社会影响的薄弱关联。

12月10日周二
  1. DeepSeek API updates39

    DeepSeek 升级 deepseek-chat 模型至 DeepSeek-V2.5-1210

    DeepSeek 将 deepseek-chat 模型升级为 DeepSeek-V2.5-1210,数学能力在 MATH-500 基准测试中从 74.8% 提升至 82.8%,代码能力在 LiveCodebench(08.01-12.01)准确率从 29.2% 提升至 34.38%。中文写作与推理能力在内部测试集中也有提升,同时优化了文件上传和网页总结功能的用户体验。

9月5日周四
6月28日周五