字节开源 FLUX Dev 的 Haper SD Lora,只需要 8 步或者 16 步就可以用 FLUX 生成图片! 文章附模型下载链接

本文主要是介绍字节开源 FLUX Dev 的 Haper SD Lora,只需要 8 步或者 16 步就可以用 FLUX 生成图片! 文章附模型下载链接,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

2024 年 8 月 26 日,字节开源了 FLUX Dev 的 Haper SD Lora。 只需要 8 步或者 16 步就可以用 FLUX 生成图片,大幅减少 FLUX 的生成时间。

建议 LoRA 比例约为 0.125,该比例可适应训练和指导,比例可保持在 3.5。较低步骤的 LoRA 即将推出。

大家可以点击下面文章链接, 文章包含模型下载链接,试用地址,项目介绍等,也欢迎大家关注公众号AIGC Studio。

字节开源 FLUX Dev 的 Haper SD Lora,只需要 8 步或者 16 步就可以用 FLUX 生成图片!

为了让更多的人体验到Hyper SD Lora的神奇效果,字节跳动在Huggingface上设立了演示空间。在这里可以直观地感受到FLUX8步Lora的绘图效果,亲眼见证AI绘图技术的飞跃。

相关链接

论文地址:https://arxiv.org/pdf/2404.13686 项目地址:https://hyper-sd.github.io/

模型链接:https://huggingface.co/ByteDance/Hyper-SD

试用地址:https://huggingface.co/spaces/ByteDance/Hyper-FLUX-8Steps-LoRA

论文阅读

Hyper-SD:用于高效图像合成的轨迹分段一致性模型

摘要

最近,出现了一系列考虑扩散的蒸馏算法,以减轻与扩散模型 (DM) 的多步推理过程相关的计算开销。当前的蒸馏技术通常分为两个不同的方面:i)ODE 轨迹保存;ii)ODE 轨迹重构。然而,这些方法存在严重的性能下降或领域转移。

为了解决这些限制,我们提出了Hyper-SD,这是一个新颖的框架,它协同融合了 ODE 轨迹保存和重构的优点,同时在步骤压缩期间保持近乎无损的性能。首先,我们引入轨迹分段一致性蒸馏,以在预定义的时间步长段内逐步执行一致性蒸馏,这有助于从高阶角度保留原始 ODE 轨迹。其次,我们结合人工反馈学习来提高模型在低步长范围内的性能,并减轻蒸馏过程造成的性能损失。第三,我们集成了分数蒸馏,以进一步提高模型的低步生成能力,并首次尝试利用统一的 LoRA 支持所有步骤的推理过程。

大量实验和用户研究表明,对于 SDXL 和 SD1.5,Hyper-SD 在 1 到 8 个推理步骤中都实现了 SOTA 性能。例如,在 1 步推理中,Hyper-SDXL 在 CLIP 分数上超过 SDXL-Lightning +0.68 ,在 Aes 分数上 超过 +0.51 。

方法

Hyper-SD 采用两阶段渐进式一致性蒸馏。第一阶段在两个不同的时间段 [0, T/2] 和 [T/2 , T] 进行一致性蒸馏,以获得两段一致性 ODE。然后,在后续阶段采用此 ODE 轨迹来训练全局一致性模型。

实验

Hyper-SD 与其他方法之间的视觉比较。从第一列到第四列,这些图像的提示分别是

  1. 一只穿着白色 T 恤的狗,上面写着 "hyper" 一词…

  2. 抽象美、接近完美、纯粹的形式、黄金比例、简约、未完成…

  3. 一颗水晶心躺在宁静的禅宗花园的苔藓上……

  4. 科学家雄鹿的拟人化艺术,维多利亚风格的服装,由 krenz cushart 创作...。

Hyper-SD 与 SDXL 架构上其他基于 LoRA 的加速方法之间的定性比较。

Hyper-SD 与其他基于 LoRA 的加速方法在 SD15 架构上的定性比较。

Hyper-SD 与现有的专注于加速的方法相比表现出了显著的优势,并在 SD1.5 和 SDXL 架构上获得了更多的用户偏好。

具有不同步骤的 Hyper-SD LoRA 可应用于不同的基础模型,并持续生成高质量图像

Hyper-SD 的统一 LoRA 与 ControlNet 兼容。示例以涂鸦或精明图像为条件。

结论

我们提出了 Hyper-SD,这是一个统一的框架,可最大限度地提高扩散模型的几步生成能力,在 SDXL 和 SD15 的基础上实现了新的 SOTA 性能。通过采用轨迹分段一致性蒸馏,我们增强了蒸馏过程中的轨迹保存能力,接近原始模型的生成能力。然后,人工反馈学习和变分分数蒸馏激发了少步推理的潜力,从而为生成模型提供了更优化和更高效的轨迹。我们为 SDXL 和 SD15 开源了从 1 到 8 步推理的 LoRA,以及专用的一步 SDXL 模型,旨在进一步推动生成 AI 社区的发展。

这篇关于字节开源 FLUX Dev 的 Haper SD Lora,只需要 8 步或者 16 步就可以用 FLUX 生成图片! 文章附模型下载链接的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1117528

相关文章

大模型研发全揭秘:客服工单数据标注的完整攻略

在人工智能(AI)领域,数据标注是模型训练过程中至关重要的一步。无论你是新手还是有经验的从业者,掌握数据标注的技术细节和常见问题的解决方案都能为你的AI项目增添不少价值。在电信运营商的客服系统中,工单数据是客户问题和解决方案的重要记录。通过对这些工单数据进行有效标注,不仅能够帮助提升客服自动化系统的智能化水平,还能优化客户服务流程,提高客户满意度。本文将详细介绍如何在电信运营商客服工单的背景下进行

关于数据埋点,你需要了解这些基本知识

产品汪每天都在和数据打交道,你知道数据来自哪里吗? 移动app端内的用户行为数据大多来自埋点,了解一些埋点知识,能和数据分析师、技术侃大山,参与到前期的数据采集,更重要是让最终的埋点数据能为我所用,否则可怜巴巴等上几个月是常有的事。   埋点类型 根据埋点方式,可以区分为: 手动埋点半自动埋点全自动埋点 秉承“任何事物都有两面性”的道理:自动程度高的,能解决通用统计,便于统一化管理,但个性化定

字节面试 | 如何测试RocketMQ、RocketMQ?

字节面试:RocketMQ是怎么测试的呢? 答: 首先保证消息的消费正确、设计逆向用例,在验证消息内容为空等情况时的消费正确性; 推送大批量MQ,通过Admin控制台查看MQ消费的情况,是否出现消费假死、TPS是否正常等等问题。(上述都是临场发挥,但是RocketMQ真正的测试点,还真的需要探讨) 01 先了解RocketMQ 作为测试也是要简单了解RocketMQ。简单来说,就是一个分

AI一键生成 PPT

AI一键生成 PPT 操作步骤 作为一名打工人,是不是经常需要制作各种PPT来分享我的生活和想法。但是,你们知道,有时候灵感来了,时间却不够用了!😩直到我发现了Kimi AI——一个能够自动生成PPT的神奇助手!🌟 什么是Kimi? 一款月之暗面科技有限公司开发的AI办公工具,帮助用户快速生成高质量的演示文稿。 无论你是职场人士、学生还是教师,Kimi都能够为你的办公文

使用opencv优化图片(画面变清晰)

文章目录 需求影响照片清晰度的因素 实现降噪测试代码 锐化空间锐化Unsharp Masking频率域锐化对比测试 对比度增强常用算法对比测试 需求 对图像进行优化,使其看起来更清晰,同时保持尺寸不变,通常涉及到图像处理技术如锐化、降噪、对比度增强等 影响照片清晰度的因素 影响照片清晰度的因素有很多,主要可以从以下几个方面来分析 1. 拍摄设备 相机传感器:相机传

Andrej Karpathy最新采访:认知核心模型10亿参数就够了,AI会打破教育不公的僵局

夕小瑶科技说 原创  作者 | 海野 AI圈子的红人,AI大神Andrej Karpathy,曾是OpenAI联合创始人之一,特斯拉AI总监。上一次的动态是官宣创办一家名为 Eureka Labs 的人工智能+教育公司 ,宣布将长期致力于AI原生教育。 近日,Andrej Karpathy接受了No Priors(投资博客)的采访,与硅谷知名投资人 Sara Guo 和 Elad G

阿里开源语音识别SenseVoiceWindows环境部署

SenseVoice介绍 SenseVoice 专注于高精度多语言语音识别、情感辨识和音频事件检测多语言识别: 采用超过 40 万小时数据训练,支持超过 50 种语言,识别效果上优于 Whisper 模型。富文本识别:具备优秀的情感识别,能够在测试数据上达到和超过目前最佳情感识别模型的效果。支持声音事件检测能力,支持音乐、掌声、笑声、哭声、咳嗽、喷嚏等多种常见人机交互事件进行检测。高效推

常用的jdk下载地址

jdk下载地址 安装方式可以看之前的博客: mac安装jdk oracle 版本:https://www.oracle.com/java/technologies/downloads/ Eclipse Temurin版本:https://adoptium.net/zh-CN/temurin/releases/ 阿里版本: github:https://github.com/

安卓链接正常显示,ios#符被转义%23导致链接访问404

原因分析: url中含有特殊字符 中文未编码 都有可能导致URL转换失败,所以需要对url编码处理  如下: guard let allowUrl = webUrl.addingPercentEncoding(withAllowedCharacters: .urlQueryAllowed) else {return} 后面发现当url中有#号时,会被误伤转义为%23,导致链接无法访问

pdfmake生成pdf的使用

实际项目中有时会有根据填写的表单数据或者其他格式的数据,将数据自动填充到pdf文件中根据固定模板生成pdf文件的需求 文章目录 利用pdfmake生成pdf文件1.下载安装pdfmake第三方包2.封装生成pdf文件的共用配置3.生成pdf文件的文件模板内容4.调用方法生成pdf 利用pdfmake生成pdf文件 1.下载安装pdfmake第三方包 npm i pdfma