作者用 3 天生成 730 张图片测试 GPT Images 2.5,给出总体感分 82/100、生成成功率 96.6%、一次到位体感 75–80%。其核心结论是单次生成很强,但多轮或复杂创作无法稳定保持设计状态,成本从生成转向对齐。总结的五大问题包括主体身份漂移、连续 5 轮后风格衰减、手部与机械结构等结构错误、设计能力薄弱,以及修正局部引发新漂移即修 A 坏 B。
3 天高强度 GPT Images 2.5 ➡️ 数据统计 + 5 大问题总结:
【总体感分】82/100
【核心问题总结】单次生成很强,多轮/复杂创作无法稳定地保持设计状态,成本不再是生成而是对齐
【生成成功率】96.6%
【一次到位体感】75–80%
【专业连续编辑能力】74/100
【时间】9.9-9.11
【生成总数】730张
【日均】243张
【用途】前2天测试(重广度,不重深度),第3天创作(重深度,不重广度)
【返工】 25次
【返工密度】1次/29.2张,3.56/100张
【连续返工最长】6轮
【创作返工】13次,占比52%(总返工
【返工密度】1次/26.8张,3.72/100张
【创作生成量】349张,占比48%(总量
【核心问题】
【1】Identity Drift|主体身份漂移:
多轮/复杂组合任务中特征丢失、主体信息衰减
【2】Style Drift|风格一致性不稳定:
连续 5 轮之后明显衰减/丢失
【3】Structural Failure|结构错误:
手部、姿势、接触关系、机械结构设计等是最大结构短板
硬伤,暂无法很好解决,还停留在仅仅看个样子阶段
【4】Design Failure|设计能力较差:
设计能力依旧是严重的语言式思维,并且在将语言式落实为视觉式表达能力很弱(常说的概念强手不行
经常把“重新设计”理解成“轻微修改”
【5】Local Fix Cascade|局部修正容易引发新的漂移,也就是“修 A 坏 B”
来源:@ZHO_ZHO_ZHO · x.com