跳到正文
Google Developers Blog·· 2026-08-17AI 评分35

Google Tunix:用高吞吐 Agentic RL 训练多轮工具调用智能体

Scaling Agentic RL: High-Throughput Agentic Training with Tunix

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

Google 推出 JAX 原生后训练库 Tunix,用于消除训练多轮、工具调用型 LLM 推理智能体时的 TPU 闲置瓶颈。它通过高并发异步 rollout 与解耦的生产者-消费者流水线提升硬件吞吐,让训练器在智能体等待网络 I/O 或环境步骤时仍持续获得数据。Tunix 还提供即插即用抽象与持续的宏观层面 profiling,便于接入自定义开源环境并优化分布式工作流。

来源:Google Developers Blog · developers.googleblog.com