跳到正文

评测基准

模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。

当前仅显示精选新闻

最新精选

第 61–63 条 · 共 63 条
3月6日周五
  1. Manus Blog68

    Manus 评测 7 款 AI 应用构建工具:同一提示下谁最能交付完整应用

    Manus 用同一个 Solace Studio 健康工作室应用提示,实测 Manus、Lovable、Base44、Replit、Bubble、Figma App Builder 和 Glide 七个平台。结论是 Manus 综合最佳,几乎从单一提示交付支付、取消政策和预订逻辑等完整堆栈;Lovable 原型最精美,Replit 最适合开发者,多数平台仍主要生成前端,后端逻辑需手动补齐。

    推荐理由:同一提示实测七款工具,指出多数平台只生成前端而支付与预订逻辑才是分水岭,结论可用于选型参考。

2月24日周二
  1. AI as Normal Technology70

    AI as Normal Technology 团队发布论文《Towards a Science of AI Agent Reliability》

    Sayash Kapoor、Arvind Narayanan 与 Stephan Rabanser 等人发布 66 页论文《Towards a Science of AI Agent Reliability》,将智能体可靠性拆解为一致性、鲁棒性、可预测性、安全性四维共 12 项指标。

    推荐理由:论文把智能体可靠性拆成12个维度并实测14个模型,显示18个月内准确率大涨而可靠性仅小幅提升。

9月25日周四
  1. Factory 研究 / 产品64

    Factory Droid 以 58.8% 登顶 Terminal-Bench,并详解智能体设计方法

    Factory 宣布其软件开发智能体 Droid 以 58.8% 的任务解决率在 Terminal-Bench 排行榜第一,Opus 4.1、GPT-5 和 Sonnet 4 三种单模型配置均显著领先其他单模型智能体,并超过 Codex CLI(42.8%)和 Claude Code(43.2%)。

    推荐理由:原文在成绩之外给出智能体设计的可复用做法,如分层提示词、模型专属适配和精简工具,能帮助改进自己的 Agent。