DeepSeek 升级 deepseek-chat 至 DeepSeek-V2-0628,推理与角色扮演能力提升
DeepSeek 官方宣布 deepseek-chat 模型升级为 DeepSeek-V2-0628,推理能力提升。
推荐理由:官方给出代码、数学、推理和对战胜率的前后对比数据,读者可以据此评估这次升级的实际幅度。
模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。
当前仅显示精选新闻DeepSeek 官方宣布 deepseek-chat 模型升级为 DeepSeek-V2-0628,推理能力提升。
推荐理由:官方给出代码、数学、推理和对战胜率的前后对比数据,读者可以据此评估这次升级的实际幅度。
OpenAI 用自研强化学习算法 PPO 训练 5 个智能体组成的团队打 Dota,击败了半职业选手。智能体对两周前的旧版本胜率达 90-95%,训练不使用人类对局数据,仅靠自我对弈和人工设计的奖励函数学会游戏。作者认为这说明深度强化学习在算力足够且模拟环境贴合问题时能解决极难问题,有望推广到更像真实世界的场景。
推荐理由:作者作为当事方说明了不依赖人类对局、靠自我对弈训练的路线,读者可以借此理解强化学习对算力和模拟环境的依赖。