买球集团股份有限公司 - 十大买球平台 语言培训在线教育

您好,欢迎访问买球集团股份有限公司官方网站!

0523-89999692

全国咨询热线

您现在所在位置: 主页 > 行业资讯

文生图Scaling新变量被字节Seed团队发现了

更新时间:2026-08-15

  

文生图Scaling新变量被字节Seed团队发现了(图1)

  但训练图像所配 Caption 的信息量,却很少被作为一个独立变量系统研究。ByteDance Seed 团队发现:自然语言 Caption 变长,并不意味着模型获得了更多可用的视觉监督;相比长度,Caption 中与图像绑定的信息量更能预测扩散模型最终达到的训练损失。

  基于这一发现,团队提出 Structured Prompt,并从 Diffusability 与 Promptability 两侧共同提升文本条件,最终在复杂组合、推理和世界知识生成任务上取得显著提升。

  过去几年,文生图模型的进步几乎沿着一条熟悉的路线展开:更大的模型、更多的数据,以及更高的训练算力。

  但文生图与语言模型之间存在一个容易被忽略的差异。语言模型可以直接从文本序列中进行自监督学习;文生图模型则依赖图像与 Caption 的配对,学习 “什么样的文字对应什么样的视觉内容”。图像中可能包含大量物体、属性、位置、动作和关系,但只有被 Caption 准确描述并清晰绑定的部分,才能作为文本条件监督传递给模型。

  于是,一个基础问题出现了:除了继续扩大模型、数据和算力,我们能否通过增加 Caption 所携带的图像信息,让生成模型学得更好?

  在这项新工作中,ByteDance Seed 团队研究了这一问题。核心结论可以概括为一句话:

  真正随文本条件扩展的,不是 Caption 的 token 数量,而是其中可被模型利用的图像信息。

  一个直觉做法,是把训练 Caption 或用户 Prompt 写得更长、更详细。更多 token 看起来应该意味着更多监督,也应该帮助模型生成更复杂的图像。

  实验却给出了不同答案。在多种现有开源文生图系统上,自然语言 Prompt 随长度增加很快饱和,最终输出甚至低于各自最短 Prompt 的表现。即使专门在同一套长文本 Caption 上训练扩散模型,收益也十分有限。

  为了把这个现象看得更清楚,团队设计了一个固定骨干网络的图像重建实验。对于同一张参考图像,团队从同一份完整标注出发,生成四个详细程度逐渐增加的自然语言 Caption,再使用相同的 Qwen-Image 模型和随机种子尝试还原该图像。这些 Caption 描述相同的实体和关系,后续版本主要通过补充和展开自然语言表达来增加长度。

  令人意外的是,Caption 虽然显著变长,图像重建质量却几乎不再提高。新增的 prose 更多是在解释、改写或连接已经出现的内容,并没有持续增加新的、可稳定使用的视觉变量。

  这说明,Caption 长度只是一个很弱的代理变量。一个文本可以写得很长,却仍然没有清楚说明:某个属性属于哪个物体、两个物体是什么关系、各自位于哪里,以及它们在画面中的前后层次。

  GPG 是一个需要读取模型 token 概率的白盒指标。对于同一句 Caption,团队分别让一个冻结的视觉语言模型看到和看不到配对图像,并计算图像出现后 Caption 内容 token 的对数似然提升。若 Caption 中包含大量与该图像紧密绑定的信息,看到图像应当显著提高模型对这些 token 的预测能力。

  ED 是一个不依赖 token 概率的黑盒语义指标。它分别从图像和 Caption 中提取带有实体上下文的属性,再计算 Caption 属性的准确率与图像属性的召回率。最终采用更重视准确率的 F0.5,对 Caption 中没有图像依据的描述施加更强惩罚。

  两个指标从不同角度刻画同一个问题:GPG 关注图像与文本之间的统计依赖,ED 关注 Caption 是否准确覆盖了可验证的视觉内容。

  接下来,团队固定图像、模型架构、初始化方式、优化配置和训练预算,只改变训练 Caption。整个实验包含 15 种 Caption 配置:三个不同长度的自然语言版本、六个逐步恢复字段的 Structured Prompt 版本,以及六个空间表达或字段遮蔽变体。每种配置都从同一个 BAGEL continued-training checkpoint 出发,独立训练一个扩散模型。

  结果显示,自然语言 Caption 的 token 数与训练结果并不存在统一关系;但当横轴换成 Caption 信息量后,不同格式和详细程度的配置落在了高度规律的曲线上:

  团队将其称为 text conditioning 的 scaling properties。它不是一个对所有模型都成立的理论定律,而是在固定架构与训练 recipe 下得到的经验标定。但它带来了两个直接价值。

  第一,它把 Caption 信息量从一个模糊的 “数据质量” 概念,变成了可以控制和测量的训练变量:在模型、图像和算力不变时,信息量能够预测模型最终达到的训练损失。

  第二,完成一次标定后,可以在同一训练 recipe 下先用 GPG 或 ED 比较候选 Caption 方案,再决定是否投入昂贵的扩散模型训练。对未参与拟合的六个 Caption 变体,两个指标仍能较准确地预测其收敛损失。

  前面的实验揭示了一个关键点:仅仅增加自然语言 prose 并不够,新增信息还需要以稳定、明确的方式组织起来。

  因此,团队提出 Structured Prompt(SP),用结构化 JSON 表示一张图像中的视觉变量。它包含三个层次:

  与自由文本相比,SP 的关键不只是 “JSON” 这一外观,而是让不同视觉变量进入稳定的命名字段,减少属性归属、空间关系和对象绑定上的歧义。在固定骨干重建实验中,随着 SP 字段逐步恢复,重建质量持续提高;在完整训练 sweep 中,字段覆盖增加也同步提高 GPG、ED,并降低收敛后的 diffusion loss。

  为了在大规模训练数据上生成完整 SP,团队构建了一套 image-to-SP 标注流水线。通用 VLM 负责全局语义和局部内容,Sapiens 补充人体姿态证据,DepthAnything V2 提供相对深度,SAM 2.1 提供掩码与遮挡线索,最后再由 VLM 将这些信息统一整理为一致的完整 SP。

  团队将一个 Caption 表示能够向扩散模型暴露并组织图像监督的能力称为 Diffusability。SP 提升的正是这一侧:在不改变扩散模型架构的情况下,让模型从文本条件中学到更多、更明确的视觉变量。

  训练时可以从配对图像中提取完整 SP,但实际生成时只有用户的一句话,没有参考图像或 oracle 标注。系统还需要一个 LLM prompter,把用户请求扩展成详细、连贯、且不违反原始约束的 SP。

  团队把这种从用户请求实例化结构化条件的能力称为 Promptability。端到端生成质量取决于两侧共同作用:

  这里的乘号是一种组织视角,而不是拟合得到的数学乘法公式:Diffusability 描述扩散模型能够从 Caption 表示中学到什么,Promptability 描述 LLM 在推理时能否真正填出高质量的 Caption 实例。

  但零样本 LLM 仍然倾向于生成信息不足、构图较简单的 SP。为进一步提高 Promptability,团队采用三阶段训练:

  SFT 学习扩散模型所期望的 SP 内容分布,而不只是 JSON 格式;

  消融实验表明,三阶段承担不同作用:SFT 带来最大的单阶段结构提升,cold-start 加强从用户请求到 SP 的推导,而 verifier-gated OPSD 在 prompter 自身分布上取得最强结果。

  SP 的字段化表示还有一个自然优势:当生成图像出现错误时,系统可以定位并修改相应的对象、属性、关系或布局字段,而不是重新改写整段自然语言 Prompt。

  基于此,团队构建了 refine-render-judge 循环。每一轮中,prompter 根据用户请求和历史反馈生成或修订 SP,固定 diffuser 渲染图像,在线 judge 再针对 Prompt 遵循、结构和视觉质量给出 PASS/FAIL 与具体问题。若失败,下一轮只需围绕相关字段进行调整。

  实验显示,增加迭代预算能够继续提高结构、对齐和 GSB 表现;但有效推理长度并不长。对于训练后的 prompter,即使允许最多 8 轮,平均也只使用 2.31 轮;从 Tmax = 4 增加到 8,收益已经很小。这表明,文生图确实受益于迭代纠错,但在当前设置下并不需要很长的 prompt-side reasoning trajectory:修复主要规格错误后,额外轮次会迅速饱和。

  最终系统由 SP-trained diffuser 与训练后的 LLM prompter 组成。它在几乎所有报告指标上领先所比较的开源权重模型,并在大多数评测上达到或超过所比较的闭源系统,优势在组合、推理和世界知识任务上尤其明显。

  更关键的是 matched control。为了排除 “只是多训练了一些” 的解释,团队使用完全相同的 Qwen-Image 架构、训练图像、训练阶段和预算,额外训练了一套始终使用自由自然语言 Caption 的系统。结果如下:

  Matched NL 的额外训练确实带来了一些提升,但远不足以复现 SP 系统的结果。这说明,收益不能简单归因于更大的 backbone 或更多训练,而与 prompter 和 diffuser 之间所使用的结构化 Caption 接口密切相关。

  这项工作的出发点很简单:对于文生图模型,Caption 不是无关紧要的元数据,而是图像内容进入文本条件学习的主要接口。

  因此,文生图的下一步 scaling 不应只关注 “负责渲染的模型有多大”,还应关注:

在线客服

ONLINE SERVICE

联系电话

0523-89999692

返回顶部