DroneCATS 基准评估多模态 LLM 作为无人机控制通用视觉-语言-动作智能体
Evaluating Multimodal LLMs as Generalist Vision-Language-Action Agents for Drone Control: Commanding, Approaching, Tracking and Searching
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究者提出 DroneCATS-Agent 架构与 DroneCATS 基准,将 MLLM 直接放入无人机控制回路,动作空间仅由提示词声明,无需微调或函数调用。评测覆盖接近可见目标、跟踪移动目标、搜索视野外目标及多无人机编队指挥四项能力,模型规模下探至 2B 参数。结果显示小型开源模型常比前沿模型更可靠地进入成功半径,却因过早或未声明到达而失败,多机指挥中还会盲目复制单一坐标。
来源:Hugging Face Daily Papers · arxiv.org