跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

当前仅显示精选新闻

最新精选

第 221–221 条 · 共 221 条
6月26日周二
  1. Sam Altman Blog68

    OpenAI 用 PPO 训练 Dota 智能体击败半职业选手

    OpenAI 用自研强化学习算法 PPO 训练 5 个智能体组成的团队打 Dota,击败了半职业选手。智能体对两周前的旧版本胜率达 90-95%,训练不使用人类对局数据,仅靠自我对弈和人工设计的奖励函数学会游戏。作者认为这说明深度强化学习在算力足够且模拟环境贴合问题时能解决极难问题,有望推广到更像真实世界的场景。

    推荐理由:作者作为当事方说明了不依赖人类对局、靠自我对弈训练的路线,读者可以借此理解强化学习对算力和模拟环境的依赖。