跳到正文
硅星人Pro · 微信公众号·· 2026-08-03AI 评分72

实测 Qwen3.8-Max:国产模型开始从会写代码走向能交付任务

实测Qwen3.8-Max:国产模型开始从「会写代码」走向「能交付任务」

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

硅星人自建 Agent Long-Task Benchmark,用功能完成度占 70%、证据与可交付性占 30% 的评分测试六个完整项目,发现 Qwen3.8-Max 能把复杂需求拆成项目骨架并完成主体功能,但部署、复现和长程状态一致性仍明显拖分。

来源:硅星人Pro · 微信公众号 · mp.weixin.qq.com