新智元 | Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

2024-03-13 03:04

文章标签 技术开源报告构架 diffusion midjourney dall stable 流出立大功生图暴打新智元 sora

本文主要是介绍新智元 | Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？，希望对大家解决编程问题提供一定的参考价值，需要的开发者们随着小编来一起学习吧！

本文来源公众号“新智元”，仅用于学术分享，侵权删，干货满满。

原文链接：Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

【新智元导读】Stability AI放出了号称能暴打闭源模型的Stable Diffusion 3的技术报告，采用DiT构架的新模型在灵活性和性能上都达到了新的高度。

Stability AI在发布了Stable Diffusion 3之后，今天公布了详细的技术报告。

论文深入分析了Stable Diffusion 3的核心技术——改进版的Diffusion模型和一个基于DiT的文生图全新架构！

报告地址：https://stabilityai-public-packages.s3.us-west-2.amazonaws.com/Stable+Diffusion+3+Paper.pdf

通过人类评价测试，Stable Diffusion 3在字体设计和对提示的精准响应方面，超过了DALL·E 3、Midjourney v6和Ideogram v1。

Stability AI新开发的多模态扩散Transformer（MMDiT）架构，采用了分别针对图像和语言表示的独立权重集，与SD 3的早期版本相比，显著提升了对文本的理解和文字的拼写能力。

性能评估

在人类反馈的基础之上，技术报告将SD 3于大量开源模型SDXL、SDXL Turbo、Stable Cascade、Playground v2.5 和 Pixart-α，以及闭源模型DALL·E 3、Midjourney v6 和 Ideogram v1进行了详细的对比评估。

评估员根据与给定提示的一致性、文本的清晰度以及图像的整体美观度选择了每个模型的最佳输出：

测试结果显示，无论是在遵循提示的准确性、文本的清晰呈现还是图像的视觉美感方面，Stable Diffusion 3都达到或超过了当前文生图生成技术的最高水平。

完全没有针对硬件进行过优化的SD 3模型具有8B参数，能够在24GB显存的RTX 4090消费级GPU上运行，并且在使用50个采样步骤的情况下，生成1024x1024分辨率的图像需耗时34秒。

此外，Stable Diffusion 3在发布时将提供多个版本，参数范围从8亿到80亿，从而能以进一步降低使用的硬件门槛。

架构细节曝光

在文生图的过程中，模型需同时处理文本和图像这两种不同的信息。所以作者将这个新框架称之为MMDiT。

在文本到图像生成的过程中，模型需同时处理文本和图像这两种不同的信息类型。这就是作者将这种新技术称为MMDiT（多模态Diffusion Transformer的简称）的原因。

与Stable Diffusion之前的版本一样，SD 3采用了预训练模型来提取适合的文本和图像的表达形式。

具体而言，他们利用了三种不同的文本编码器——两个CLIP模型和一个T5 ——来处理文本信息，同时使用了一个更为先进的自编码模型来处理图像信息。

SD 3的架构是在Diffusion Transformer（DiT）的基础上建立的。由于文本和图像信息的差异，SD 3为这两种信息各自设置了独立的权重。

这种设计相当于为每种信息类型配备了两个独立的Transformer，但在执行注意力机制时，会将两种信息的数据序列合并，这样就可以在各自的领域内独立工作的同时，能保持够相互参考和融合。

通过这种独特的构架，图像和文本信息之间可以相互流动和交互，从而在生成的结果中提高对内容的整体理解和视觉表现。

而且，这种架构未来还可以轻松扩展到其他包括视频在内的多种模态。

得益于SD 3在遵循提示方面的进步，模型能够精确生成集中于多种不同主题和特性的图像，同时在图像风格上也保持了极高的灵活性。

通过重赋权法改进Rectified Flow

除了推出的全新Diffusion Transformer构架之外，SD 3对于Diffusion模型也进行了重大的改进。

SD 3采用了Rectified Flow（RF）策略，将训练数据和噪声沿着直线轨迹连接起来。

这种方法让模型的推理路径更加直接，因此可以通过更少的步骤完成样本的生成。

作者在训练流程中引入了一种创新的轨迹采样计划，特别增加了对轨迹中间部分的权重，这些部分的预测任务更具挑战性。

通过与其他60种扩散轨迹（例如 LDM、EDM 和 ADM）进行比较，作者发现尽管之前的RF方法在少步骤采样中表现更佳，但随着采样步骤增多，性能会慢慢下降。

为了避免这种情况的出现，作者提出的加权RF方法，就能够持续提升模型性能。

扩展RF Transformer模型

Stability AI训练了多个不同规模的模型，从 15 个模块、450M参数到38个模块、8B参数，发现模型大小和训练步骤都能平滑地降低验证损失。

为了验证这是否意味着模型输出有实质性的改进，他们还评估了自动图像对齐指标和人类偏好评分。

结果表明，这些评估指标与验证损失强相关，说明验证损失是衡量模型整体性能的有效指标。

此外，这种扩展趋势没有达到饱和点，让我们对未来能够进一步提升模型性能持乐观态度。

作者在256 *256像素分辨率下，在4096的批大小下，用不同参数数对模型进行了500k步训练。

上图说明了长时间训练较大模型对样本质量的影响。

上表显示了GenEval的结果。当使用作者提出的训练方法并提高训练图像的分辨率时，最大的模型在大多数类别中都表现出色，在总分上超过了 DALL·E 3。

根据作者对不同构架模型的测试对比，MMDiT效果非常好，超过了DiT，Cross DiT，UViT，MM-DiT。

灵活的文本编码器

通过在推理阶段去除占用大量内存的4.7B参数的T5文本编码器，SD 3的内存需求得到了大幅降低，而性能损失微乎其微。

去除这个文本编码器不会影响图像的视觉美感（不使用T5的胜率为 50%），只会略微降低文本的准确遵循能力（胜率为46%）。

然而，为了充分发挥SD 3在生成文字的能力，作者还是建议使用T5编码器。

因为作者发现在没有它的情况下，排版生成文字的性能会有更大的下降（胜率为 38%）。

网友热议

网友们对Stability AI不断撩拨用户但是不让用的行为显得有些不耐烦了，纷纷催促赶快上线让大家使用。

看了技术报考后，网友说看来现在生图圈子要成第一个开源碾压闭源的赛道了！

参考资料：https://stability.ai/news/stable-diffusion-3-research-paper

THE END!

文章结束，感谢阅读。您的点赞，收藏，评论是我继续更新的动力。大家有推荐的公众号可以评论区留言，共同学习，一起进步。

这篇关于新智元 | Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？的文章就介绍到这儿，希望我们推荐的文章对编程师们有所帮助！

http://www.chinasem.cn/article/803451。 23002807@qq.com

相关文章

SpringBoot3实现Gzip压缩优化的技术指南

SpringBoot3实现Gzip压缩优化的技术指南

《SpringBoot3实现Gzip压缩优化的技术指南》随着Web应用的用户量和数据量增加,网络带宽和页面加载速度逐渐成为瓶颈,为了减少数据传输量,提高用户体验,我们可以使用Gzip压缩HTTP响应,... 目录1、简述2、配置2.1 添加依赖2.2 配置 Gzip 压缩3、服务端应用4、前端应用4.1 N

阅读更多...

Java利用JSONPath操作JSON数据的技术指南

Java利用JSONPath操作JSON数据的技术指南

《Java利用JSONPath操作JSON数据的技术指南》JSONPath是一种强大的工具,用于查询和操作JSON数据,类似于SQL的语法,它为处理复杂的JSON数据结构提供了简单且高效... 目录1、简述2、什么是 jsONPath？3、Java 示例3.1 基本查询3.2 过滤查询3.3 递归搜索3.4

阅读更多...

Python中随机休眠技术原理与应用详解

Python中随机休眠技术原理与应用详解

《Python中随机休眠技术原理与应用详解》在编程中,让程序暂停执行特定时间是常见需求,当需要引入不确定性时,随机休眠就成为关键技巧,下面我们就来看看Python中随机休眠技术的具体实现与应用吧... 目录引言一、实现原理与基础方法1.1 核心函数解析1.2 基础实现模板1.3 整数版实现二、典型应用场景2

阅读更多...

无需邀请码！Manus复刻开源版OpenManus下载安装与体验

无需邀请码！Manus复刻开源版OpenManus下载安装与体验

《无需邀请码！Manus复刻开源版OpenManus下载安装与体验》Manus的完美复刻开源版OpenManus安装与体验,无需邀请码,手把手教你如何在本地安装与配置Manus的开源版OpenManu... Manus是什么？Manus 是 Monica 团队推出的全球首款通用型 AI Agent。Man

阅读更多...

Java使用POI-TL和JFreeChart动态生成Word报告

Java使用POI-TL和JFreeChart动态生成Word报告

《Java使用POI-TL和JFreeChart动态生成Word报告》本文介绍了使用POI-TL和JFreeChart生成包含动态数据和图表的Word报告的方法,并分享了实际开发中的踩坑经验,通过代码... 目录前言一、需求背景二、方案分析三、 POI-TL + JFreeChart 实现3.1 Maven

阅读更多...

阿里开源语音识别SenseVoiceWindows环境部署

阿里开源语音识别SenseVoiceWindows环境部署

SenseVoice介绍 SenseVoice 专注于高精度多语言语音识别、情感辨识和音频事件检测多语言识别：采用超过 40 万小时数据训练，支持超过 50 种语言，识别效果上优于 Whisper 模型。富文本识别：具备优秀的情感识别，能够在测试数据上达到和超过目前最佳情感识别模型的效果。支持声音事件检测能力，支持音乐、掌声、笑声、哭声、咳嗽、喷嚏等多种常见人机交互事件进行检测。高效推

阅读更多...

【专题】2024飞行汽车技术全景报告合集PDF分享（附原数据表）

【专题】2024飞行汽车技术全景报告合集PDF分享（附原数据表）

原文链接： https://tecdat.cn/?p=37628 6月16日，小鹏汇天旅航者X2在北京大兴国际机场临空经济区完成首飞，这也是小鹏汇天的产品在京津冀地区进行的首次飞行。小鹏汇天方面还表示，公司准备量产，并计划今年四季度开启预售小鹏汇天分体式飞行汽车，探索分体式飞行汽车城际通勤。阅读原文，获取专题报告合集全文，解锁文末271份飞行汽车相关行业研究报告。据悉，业内人士对飞行汽车行业

阅读更多...

金融业开源技术术语

金融业开源技术术语

金融业开源技术术语 1 范围本文件界定了金融业开源技术的常用术语。本文件适用于金融业中涉及开源技术的相关标准及规范性文件制定和信息沟通等活动。

阅读更多...

安全管理体系化的智慧油站开源了。

安全管理体系化的智慧油站开源了。

AI视频监控平台简介 AI视频监控平台是一款功能强大且简单易用的实时算法视频监控系统。它的愿景是最底层打通各大芯片厂商相互间的壁垒，省去繁琐重复的适配流程，实现芯片、算法、应用的全流程组合，从而大大减少企业级应用约95%的开发成本。用户只需在界面上进行简单的操作，就可以实现全视频的接入及布控。摄像头管理模块用于多种终端设备、智能设备的接入及管理。平台支持包括摄像头等终端感知设备接入，为整个平台提

阅读更多...

计算机毕业设计大学志愿填报系统 Java+SpringBoot+Vue 前后端分离文档报告代码讲解安装调试

计算机毕业设计大学志愿填报系统 Java+SpringBoot+Vue 前后端分离文档报告代码讲解安装调试

🍊作者：计算机编程-吉哥 🍊简介：专业从事JavaWeb程序开发，微信小程序开发，定制化项目、源码、代码讲解、文档撰写、ppt制作。做自己喜欢的事，生活就是快乐的。 🍊心愿：点赞 👍 收藏 ⭐评论 📝 🍅 文末获取源码联系 👇🏻 精彩专栏推荐订阅 👇🏻 不然下次找不到哟~Java毕业设计项目~热门选题推荐《1000套》目录 1.技术选型 2.开发工具 3.功能

阅读更多...