Google Developers Blog·· 2026-08-26AI 评分35
Google Cloud 在 Cloud TPU 上为 vLLM 带来企业级长上下文多模态嵌入推理
Enterprise-Grade Precision for Long-Context Multimodal Embedding Inference on Cloud TPU
AI 导读
Google Cloud 将原生 TPU 支持集成进 vLLM,用于在 Cloud TPU 上服务 Qwen3-Embedding 系列嵌入模型,支持 4K+ token 文本与 15K+ token 多模态输入的长上下文。团队针对 TPU 做了词表 padding、懒加载初始化与 StepPool 长上下文等优化,并以余弦相似度验证数值一致性,文本目标阈值 ≥0.999、多模态 ≥0.995。
来源:Google Developers Blog · developers.googleblog.com