跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 161–170 条 · 共 170 条
9月29日周一
8月21日周四
7月1日周二
  1. Microsoft AI News68

    Microsoft 发布 MAI-DxO,在 NEJM 病例序列诊断基准上正确率达 85%

    Microsoft AI 发布 MAI-DxO 诊断编排器与 SD Bench 基准,将 304 个 NEJM 病例转化为逐步诊断挑战,MAI-DxO 正确诊断最高达 85%,是同一组有经验医生的四倍以上,且以更低检查成本得出正确诊断。

    推荐理由:原文同时给出诊断准确率、成本对比和研究局限,并说明 SD Bench 尚未公开,读者可据此理解结果边界。

6月10日周二
5月28日周三
3月24日周一
1月20日周一
12月19日周四
  1. AI as Normal Technology69

    AI 进步是否在放缓:Arvind Narayanan 等人解析模型扩展与推理扩展之争

    Arvind Narayanan、Benedikt Ströbl 和 Sayash Kapoor 撰文分析 OpenAI、Anthropic 和 Google Gemini 下一代模型遇阻后的叙事翻转,认为宣布模型扩展已死为时尚早,行业领袖的预测并不可靠。

    推荐理由:作者用可核查的证据指出业内叙事反复翻转的成因,并区分能力提升与实际社会影响的薄弱关联。

9月5日周四
6月28日周五