跳到正文
prompt-eval.com(经 Hacker News)·· 2026-07-15AI 评分30

1,018 条真实 AI 提示词评测:鲁棒性平均仅 31/100

We scored 1,018 real-world AI prompts. Robustness averaged 31/100

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

一项针对 1,018 条真实场景 AI 提示词的评测显示,模型鲁棒性平均得分仅为 31/100。该结果来自对真实世界提示词的打分,反映出当前模型在提示词变化下的稳定性仍明显不足。

来源:prompt-eval.com(经 Hacker News) · prompt-eval.com