用 Jev-as-a-Judge 提升智能体评估的可靠性。 https://x.com/omarsar0/status/2107472222398886011?s=20
https://x.com/i/article/2107258465630507009
@dair_ai · X
用 Jev-as-a-Judge 提升智能体评估的可靠性。 https://x.com/omarsar0/status/2107472222398886011?s=20
https://x.com/i/article/2107258465630507009
一项 Harvard-MIT 研究发现,在拍卖和匹配市场环境中,给 Agent 提示词加“提前规划”或“考虑对手”类指令反而整体降低表现。由于环境有已知最优策略,作者能对每个选择打分。
https://x.com/i/article/2106769688780775424
Meta 及合作者提出 Context Language Models(CLMs),把模型的实时上下文当作可自由编辑的文件,由模型自己决定保留、改写或删除内容。