AI工具箱
kohya-ss

kohya-ss

免费
AI绘画12,082 次浏览

kohya-ss 是什么?

kohya-ss/sd-scripts是Stable Diffusion模型训练工具集,由日本开发者kohya-ss创建维护。该工具集提供了LoRA、DreamBooth、Textual Inversion、Hypernetwork等多种微调训练方法的完整实现,是目前Stable Diffusion社区最主流的训练框架之一。支持SD1.5、SDXL、SD3等多个版本的模型训练,提供详细的参数配置和灵活的训练流程控制。用户可以使用自己的图片数据集训练专属风格模型或角色模型,广泛应用于个性化AI图像生成领域。配合GUI界面使用更加便捷,是AI绘画从业者和爱好者的必备训练工具。

kohya-ss 详细介绍

【工具简介】kohya-ss/sd-scripts是一套功能完整的Stable Diffusion模型微调训练工具集,支持LoRA、DreamBooth等多种训练方法。

【核心功能】①LoRA训练:支持训练轻量级LoRA适配器,在不修改基础模型的情况下学习新风格或角色,文件体积小且易于分享。②DreamBooth全量微调:支持对整个UNet和文本编码器进行微调,适合需要深度学习新概念的场景。③多种训练方法:除LoRA和DreamBooth外,还支持Textual Inversion文本嵌入训练、Hypernetwork超网络训练等多种方式。④广泛的模型兼容:支持Stable Diffusion 1.5、SDXL、SD3等不同版本的模型架构训练。⑤精细的参数控制:提供学习率调度、噪声偏移、权重正则化等丰富的训练参数,满足不同训练需求。

【适用场景】个人风格模型训练:使用自己的画作或特定风格图片训练LoRA模型,在AI生成中复现个人艺术风格。角色一致性训练:使用特定角色的多角度图片训练模型,实现同一角色在不同场景中的一致性生成。产品与品牌定制:为特定产品或视觉风格训练专用模型,用于营销素材的批量生成。

【快速入门】①克隆仓库并安装依赖,建议使用Python 3.10+环境和PyTorch 2.x。②准备训练数据集,将图片整理到指定目录并编写对应的文本描述标签。③根据训练目标选择对应的训练脚本,配置学习率、批大小、训练轮数等关键参数。④启动训练过程,使用TensorBoard监控训练状态,训练完成后在生成工具中加载模型进行测试。

【优缺点分析】优点:训练方法全面覆盖主流微调技术,社区生态成熟;支持的模型版本广泛,兼容性强;参数配置灵活,适合不同水平的用户深入调优。缺点:纯命令行操作对新手不够友好,需要理解训练原理;训练过程对显存要求较高,SDXL训练通常需要12GB以上显存;参数众多且相互影响,调参需要一定经验积累。

【适合人群】AI绘画创作者:希望训练专属风格或角色模型的插画师和设计师。AI技术研究者:研究模型微调技术和扩散模型训练的开发者。内容生产从业者:需要批量生成特定风格视觉素材的营销和媒体从业者。

kohya-ss 使用教程

kohya-ss入门教程:Stable Diffusion模型微调训练指南

入门10分钟
kohya-ss/sd-scripts是Stable Diffusion社区最主流的训练工具集,支持LoRA、DreamBooth等多种微调方法,由日本开发者kohya-ss维护。 一、快速开始 1. 确保电脑有NVIDIA GPU,显存建议8GB以上(12GB更佳),安装好CUDA和Python 3.10+ 2. 克隆项目仓库:git clone https://github.com/kohya-ss/sd-scripts.git 3. 进入目录安装依赖:pip install -r requirements.txt 4. 下载基础模型文件(如SD1.5、SDXL等),放入指定目录 5. 准备训练数据集(图片和对应的文本描述),运行测试确认环境正常 二、核心功能演示 功能1:LoRA训练(最常用) 步骤:准备20-50张目标风格或角色的图片,使用BLIP或WD14 Tagger为图片生成文本描述,将图片和描述文件放入dataset文件夹,编辑LoRA训练配置文件(设置学习率、训练步数、网络维度等参数),运行训练命令python train_network.py,训练完成后得到.safetensors格式的LoRA文件,放入WebUI的models/Lora目录即可使用。 功能2:DreamBooth训练 步骤:准备5-20张目标主题的高质量图片,创建特定的触发词(如ohwx person),配置训练参数,DreamBooth会微调整个模型,生成的模型文件可独立使用,适合训练特定人物或物体,但需要更多显存。 功能3:SDXL和SD3模型训练 步骤:下载对应的基座模型,修改配置文件中的模型路径和参数(SDXL需要更大的分辨率和显存),调整学习率和批次大小适配大模型,运行训练命令。SD3版本需要使用最新的训练脚本和特定参数配置。 三、实际使用案例 案例1:个人风格LoRA训练 一位插画师想让AI生成自己画风的作品。收集了30张自己的插画作品,用tagger工具自动生成描述,训练了一个LoRA模型(维度设为128,训练2000步)。之后在WebUI中使用触发词加上自己的描述,就能生成具有个人画风的新作品,用于创作参考和灵感激发。 案例2:产品形象训练 电商团队需要统一的产品形象图片。用20张产品不同角度的照片训练LoRA,之后可以生成产品在各种场景中的图片,保持产品外观一致性,用于广告素材批量制作,大幅降低了拍摄和设计成本。 四、常见问题FAQ Q1:训练出来的LoRA效果不好怎么办? A1:首先检查训练数据质量,图片要清晰、多样、有代表性。其次调整学习率(推荐1e-4到5e-4)和训练步数(太少欠拟合,太多过拟合)。LoRA维度建议从32或64开始,效果不够再增大。 Q2:训练过程中显存溢出怎么办? A2:降低batch size到1,开启gradient checkpointing和mixed precision(fp16或bf16),减小训练分辨率。如果还不够,使用优化器优化器选项如AdamW8bit。SDXL训练建议至少12GB显存。 五、小贴士 1. 训练数据的文本描述质量至关重要。建议先用自动打标工具生成,再人工修正关键描述,特别是触发词相关的描述要准确。 2. 训练时开启sample image功能,每隔一定步数生成样图查看效果,及时发现过拟合或欠拟合问题,避免浪费训练时间。 3. 多个LoRA可以叠加使用,权重可调。建议每个LoRA专注训练一个主题(一个角色、一种风格),这样组合使用更灵活。
查看完整使用指南

工具信息

分类AI绘画
定价免费
浏览量12,082

用户评分

-

0 个评分

相关工具推荐

Stable Diffusion WebUI
Stable Diffusion WebUI

Stable Diffusion WebUI是由AUTOMATIC1111开发的Stable Diffusion图形化操作界面,是目前最流行的AI绘画本地部署工具之一。它将Stable Diffusion模型的强大能力封装为易用的Web界面,支持文生图、图生图、图像修复、模型管理等丰富功能。支持LoRA、ControlNet等扩展插件,社区生态活跃,拥有大量模型和教程资源。适合希望在本地运行AI绘画的创作者和开发者。

163,625
ComfyUI
ComfyUI

ComfyUI是一款基于节点工作流的Stable Diffusion图形界面工具,通过拖拽连接节点的方式构建图像生成流程。相比传统WebUI,ComfyUI提供了更灵活、更精细的工作流控制能力,支持复杂的多模型串联和条件控制。用户可以可视化地构建从提示词处理、模型加载、采样到图像输出的完整流程。支持SDXL、Flux等最新模型,工作流可保存复用,适合需要精细控制生成过程的高级用户。

72,112
Docling
Docling

Docling是由IBM Research Zurich创建、现由LF AI & Data基金会托管的开源文档处理库,支持解析PDF、DOCX、PPTX、XLSX、HTML、EPUB、图片、音频、邮件等30+种格式,转换为统一的DoclingDocument结构后导出为Markdown、HTML、JSON等格式。具备高级PDF版面理解、OCR识别、图表解析和语音转写能力,可与LangChain、LlamaIndex等AI框架无缝集成。

61,081
Fooocus
Fooocus

Fooocus是一款由lllyasviel开发的AI图像生成工具,以极简操作著称,被誉为AI绘画领域的Midjourney替代品。它基于Stable Diffusion XL模型,但将复杂的参数配置隐藏在底层,用户只需输入文字描述即可获得高质量图像。支持图像修复、图像扩展、风格控制等功能,同时保持了Stable Diffusion的本地运行优势。无需GPU高端配置,8GB显存即可流畅运行,是新手入门AI绘画的理想选择。

49,665