LLaDA 团队于 9 月 4 日正式开源 LLaDA-Image,推出 60 亿参数(6B) 图像生成模型家族,并同步发布 Base 与 Turbo 两个版本,以及模型权重和推理代码。团队表示,LLaDA-Image 是一个统一的图像生成与编辑模型,无需额外编辑模型即可同时完成文生图和指令式图像编辑任务。
LLaDA-Image 包含两个版本:
LLaDA-Image Base 采用 50 步采样,面向高质量图像生成与编辑;
LLaDA-Image-Turbo 则通过 Twin-DMD 蒸馏 技术,将采样步数压缩至 4 步,实现更快的推理速度。两者均支持文生图、参考图编辑、VQ 条件生成以及中英文文字渲染。
团队提出了一套新的训练流程:先通过纯图像预训练(Image-only Pre-training) 学习视觉先验,再引入图文配对数据进行监督训练,最后联合优化图像生成与编辑任务。官方认为,这种训练方式能够提升模型的视觉理解能力,并增强生成质量。
在评测中,官方表示 LLaDA-Image 在 Qwen-Image-Bench 上取得 英文 53.53、中文 53.38 的综合成绩,达到当前公开模型中的领先水平(SOTA)。
开源计划方面,目前团队已开放 模型权重 和 基于 Diffusers 的推理代码,并表示训练代码将在后续发布,进一步完善完整开源生态。
目前 LLaDA 系列已由蚂蚁集团旗下 Inclusion AI 团队维护。Inclusion AI 是蚂蚁集团面向 AGI 研究设立的开源组织,负责持续推进 LLaDA 系列扩散语言模型及多模态模型的发展。
(Github)