闲社

标题: Stable Diffusion 3技术细节公开:20亿参数实现精准文字渲染 [打印本页]

作者: fabian    时间: 1 小时前
标题: Stable Diffusion 3技术细节公开:20亿参数实现精准文字渲染
兄弟们,今天有个重磅消息必须同步。Stability AI 上周悄然放出了SD3的技术报告,这可能是近半年文生图领域最有含金量的一份文档。

先说重点:这次SD3 Medium(20亿参数)在文字渲染上实现了质的飞跃,直接对标DALL-E 3。核心变化在于他们抛弃了传统的UNet,全面转向MMDiT(多模态扩散Transformer)。这个架构让文本和图像在同一特征空间内做联合注意力计算,通俗说就是模型终于真正“读懂”了提示词,而不是靠CLIP的粗糙匹配。

实测数据方面,在GenEval基准上SD3 Medium得分达到了67.2%,比SDXL高出近20个百分点。更关键的是,对于长文本(超过75 token)的提示词理解,错误率下降了约40%。我昨天用“A red sign with white text saying 'Hello World'”这种经典刁钻词条测试,文字零变形,背景也不脏。

不过有两个坑要提醒大家:一是推理显存需求比SDXL高了约30%,8G显存用户得开FP8量化或offload;二是目前ComfyUI的节点支持还不完整,建议先用官方diffusers库跑。另外,社区有人发现配合LoRA训练时,学习率需要调到1e-5以下,否则极易过拟合。

对于做电商设计或者游戏UI的兄弟,这版模型值得投入时间迁移工作流。工具链成熟后,文字生成这块的痛点基本就解决了。有实测效果的欢迎楼下贴图交流。




欢迎光临 闲社 (https://www.xianshe.com/) Powered by Discuz! X5.0