跳到正文
Hugging Face Daily Papers·· 5 天前AI 评分42

SimuVerity:面向工程级 Simulink 模型生成的智能体基准测试

SimuVerity: Benchmarking Agents for Engineering-Grade Simulink Model Generation

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

SimuVerity 是一个包含 101 个文本到可执行 Simulink 模型生成任务的基准,覆盖十个工程领域,从准确性、输出质量、机制保真度、控制与因果完整性、运行域鲁棒性和动态响应六个维度评估智能体。对六个智能体系统的评测显示,最佳系统总分仅 42.86,结构相似度无法代表工程性能,部分高分模型仍存在严重的视觉布局混乱问题。

来源:Hugging Face Daily Papers · arxiv.org