实测 Qwen3.8-Max:国产模型开始从会写代码走向能交付任务
实测Qwen3.8-Max:国产模型开始从「会写代码」走向「能交付任务」
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
硅星人自建 Agent Long-Task Benchmark,用功能完成度占 70%、证据与可交付性占 30% 的评分测试六个完整项目,发现 Qwen3.8-Max 能把复杂需求拆成项目骨架并完成主体功能,但部署、复现和长程状态一致性仍明显拖分。
来源:硅星人Pro · 微信公众号 · mp.weixin.qq.com