📑 版本索引(共 134 个版本,点击展开/收起)
更新日志
每一次升级,都为了让"训练真正能用"这件事更稳、更省心。
← 返回首页
v6.6.2 2026-09-19 · 本地模型自由选 · 闲置自动释放显存 · 删掉「模型体检」
- 🧩 本地模型:目录里放什么就能跑什么(改 · 重要):换一个没见过的 GGUF,以前会撞上「未找到对应的 mmproj 视觉投影文件」—— 其实文件就在旁边。根因是代码里有一张硬编码的架构清单,清单没跟上的新模型一律被判为「不可用」。现在以 llama.cpp 为准:删掉架构白名单,不再替顾客预判;视觉投影只按目录内容 + 文件名相似度配对(同名前缀、词元重合都算);qwen*-vl 系列的视觉编码器是内置的,会自动不加 -mm(以前会画蛇添足);启动失败时原样透传 llama.cpp 的报错,不再包装成一句笼统的「模型不存在」。顺带修了一个配对 bug:mmproj-B-F16.gguf 会因为「b」是别的名字的子串而被错配。以后 llama.cpp 升级、出了 qwen3.9 / 新架构,不改代码就能直接用。
- 🗑 删掉「模型体检」(删):上一版加的体检面板要先「体检」再「选档位」,流程太重、太打扰 —— 现在整块删除,连同「该下哪个档位」按钮和背后的显存建议逻辑一起清掉,判断「能不能跑」的活儿交回给 llama.cpp。(「目录里有什么就认什么」的核心逻辑保留,只是不再拿它打扰你。)
- 🎯 本地服务用哪个模型,你说了算(新):设置页新增选项 —— 跟随打标页(默认,打标页选哪个就用哪个,零配置)或固定某个(打标页切模型不影响 Agent 天使和标签翻译);固定的模型被删了会优雅退回打标页的选择,不会崩。DSH 的模型下拉框显示的也不再是没意义的 local-model,而是真实模型名(如 Qwen3.8-27B-Uncensored-IQ4_XS),一眼认得出自己选的是哪个。
- 💤 按需加载 + 闲置自动释放显存(新 · 重要):27B 常驻要吃 14.4GB,训练和出图就没显存了。现在起一个常驻轻量代理(只占几十 MB),管住大模型的生死:收到请求 → 服务没跑就自动拉起 → 转发 → 刷新计时;闲置 10 分钟没人用就自动释放显存,还给训练/出图。打标和对话进行中不会被释放(跑完才开始计时),时长可调(3 分钟 / 10 分钟 / 30 分钟 / 2 小时 / 常驻不释放),另有「立即释放显存」按钮,训练前想马上腾卡不必等超时。代价说清楚:释放后第一句话要等加载(27B 约 10-30 秒,4B 约 3-5 秒)。
- 🔧 修「自动同步一直白做」(修):本地模型的配置以前写进 resources 下的 .dsh-angel/settings.yaml,但 DSH 实际读的是 DSH_HOME 指向的那份,于是配置压根没生效 —— 顾客在 DSH 里怎么都看不到「Agent Angel (本地)」。修的过程中还走过一次弯路:改用「哪份最近改过」来猜,结果又挑错了;最终改为以 DSH_HOME 环境变量为准,不再靠猜。
- 📋 设置页新增「在 DSH 里怎么填」(新):自动填失败时顾客不该无路可走 —— 面板直接列出可复制的 API 地址、模型名(各带一个复制按钮)与当前配置文件的实际路径(一眼看出写到了哪),外加密钥留空的说明;另有「重新接通 DSH」按钮,手动触发重写并回读确认真的写进去了,写失败会明确报原因,而不是假装成功。
- ℹ️ 能力边界(说明):本地模型同一时刻只加载一个(27B 单独就吃约 14.4GB,装不下第二个);切换模型需要重新加载,期间 DSH 对话会短暂中断;双档(自动切换快慢模型)未做,保留手动选择 —— 要质量用 27B,要快用 4B。
v6.6.1 2026-09-18 · 「声音库」更名「配音库」· 音色失效不再静默
- 🏷「声音库」改名「配音库」(改):名字直接说清它是干嘛的 —— 库里放的是给片子配音的声音。剪辑页「更多」菜单、抽屉标题、建卡弹窗、情绪面板、「加入配音库」按钮全部同步更名,一眼就知道该去哪儿找。(画布那边的「配音节点」本来就同名,现在两处叫法统一了。)
- 🔔 选了声音却没生效,现在会明确告诉你(修):以前音色卡的参考录音被挪走或删掉时,配音会悄悄退回默认声线 —— 配音照常生成、界面一切正常,只能靠耳朵发现「念出来不是我要的声音」。现在会当场提示是哪张卡、原始路径是什么:画布配音节点、文字配音、字幕批量配音、图文成片、以及声音卡的试听按钮,全都会说。配音仍然正常出结果(不会因为提示就失败)。
- 🎧 试听就能发现素材坏了(新):试听按钮现在会检查参考录音是否还在 —— 建完卡先点一下 ▶,声音不对当场知道,不必等整片配完才发现白念了几十条。
v6.6.0 2026-09-17 · 安装包瘦身 68%(1.17GB → 370MB)· 配音/音乐节点一屏操作 · 打标更快更稳
- 📦 安装包瘦身 68%(重要 · 改):1.17GB → 370MB。两样大件改成用到时再装 —— H3 训练适配器(444MB,开始 H3 训练时自动从镜像获取)与 本地打标引擎 llama.cpp(约 500MB,见下条)。功能一个没少。
- 🖥 Agent 天使 能用本地模型了(新):在 设置 → DSH 天使 打开「Agent 天使 用本地模型」,然后在对话页的模型里选「Agent Angel (本地)」即可完全离线使用。它复用打标 / 提示词反推那个本地服务(同一个模型、同一份显存,不额外占用);没装本地引擎时自动走云端,不受影响。
- 🧩 本地引擎自己装(新):打开 设置 → 本地引擎 llama.cpp,点「打开网盘下载」拿包、再用「导入 zip 包」装好即可;也可以把已有的 llama.cpp 目录填进去。没装也不影响打标 / 翻译 —— 会自动走 DeepSeek API 兜底。
- ⚡ 打标:Qwen3.5 直接跑本地引擎(修 · 重要):以前选 Qwen3.5 必须额外装一套 1.3GB 的 Python 环境,很多人根本没装 ⇒ 一点打标就报「旧 Python 后端不可用」。现在它直接走 llama.cpp:实测加载 4 秒、每张图 0.7~0.8 秒出标签,不再需要那 1.3GB。
- 🚫 修掉「打标打出空白」(修 · 重要):Qwen3.5 这类会先思考的模型,以前约一半到七成的图会写成空标签(.txt 是空的)。现在关闭它的思考过程,实测 0 张空、速度快约 7 倍;标签翻译同样处理(快约 18 倍)。
- 🎛 配音 / 音乐节点:一屏就能操作(改):节点上只留核心输入 —— 配音节点只留台词,音乐节点只留风格 + 歌词,其余参数收进右侧「高级参数」抽屉;不再是一竖排滚不到底。
- 💾 引擎按需开关、用完自动放显存(新):配音默认用 IndexTTS2,抽屉里可「开启引擎 / 结束引擎」,并可勾选生成后自动释放显存;音乐节点成歌后自动卸载 YuE2(它要占约 14GB 显存)。
- 🎭 情绪跟剪辑 Pro 同一套(改 + 修):画布的情绪控件改成与剪辑一致 —— 跟随声音卡 / 文字描述 / 参考音频 三档 + 常用情绪一键选 + 强度滑块。顺带修掉一个真 bug:以前画布上的情绪、语速、参考音频设了根本不生效。
- 🔊 参考音频能选也能传(新):音色卡改成列表,每张可 ▶ 试听参考原声并显示时长;参考音频支持直接上传(wav/mp3/m4a…)。参考过短(<3 秒)会标黄提醒 —— 那种长度克隆出来会「飘」,听着像方言。
- ⌫ 生成的结果能删、能挑着送剪辑(新):配音 / 音乐的结果列表每行可 ▶ 试听 / ○ 选中 / ✕ 删除(删除进回收站、可恢复);「送去剪辑」发的是你选中的那条,不再总是发最新的那条。
- ✨ 从音视频自动提取声音(新):声音库新增入口 —— 选一段音频或视频,自动切句、按说话人分组,逐段试听勾选后一键存成音色卡。能力边界如实标注:稳态底噪(空调 / 嘶声)会压掉,背景音乐去不掉。
- 🔗 画布 API:服务商一键选 + 失败原因说清楚(改):内置 9 家(OpenAI / GrsAI / DeepSeek / 智谱 / 通义 / Kimi / 硅基流动 / 火山方舟 / 自定义),选中自动填接口地址;「测试连接」会明确告诉你是 Key 不对(401)、地址少了 /v1(404)还是网络不通,不再只有一句「连接失败」。
- 📥 导入环境包更可靠(修):几百 MB 的大压缩包以前偶发「解压一半、不报错、装完仍不可用」,已改用系统自带的解压组件来完成。
- 🧭 画布细节(改):左上角只留「设置」与项目名两个入口;右键「添加节点」菜单图标统一、标签对齐、加了分组标题。
v6.5.0 2026-09-15 · Angel 画布会唱歌:新增「音乐」节点 · 歌词 → 乐谱 → 整首歌 · 全程本地推理
- 🎵 画布新增「音乐」节点:本地出歌(新):给它一段歌词(也可以从旁边接一个文本节点当歌词)、一句风格描述,就能出一首完整的歌 —— 和画画、剪辑一样,推理全在你自己的显卡上跑,不上传、不联网。三步走,中间那步能插手:写歌词(可用
[Verse] / [Chorus] 分段;副歌重复着写更省显存)→ 出乐谱(先生成一份可编辑的 ABC 乐谱,调性 / 速度 / 和弦都能改,改完再往下走)→ 渲染成歌(完成后节点上直接播放,一键 ⇥ 送去剪辑 当 BGM / 主题曲)。
- 📦 音乐引擎按需安装(新):不随安装包发货。节点里直接显示引擎状态,两条路任选 —— ⬇ 自动下载安装(首次约 12GB,其中 PyTorch 约 2.9GB;可中断、可续传,不用梯子)或 📦 导入环境包(作者放网盘的运行时包 2.71GB,比自动下载快;权重仍自动获取)。装一次之后离线可用。
- 🎛 做到哪一步看得见(新):卡面直接显示「写歌词 → 出乐谱 → 渲染成歌」走到哪一步,面板顶部同步「步骤 N / 3」;面板按「输入 / 生成 / 结果」分组,结果区空着时也会说明成歌后这里会出现什么。
- 🚫 没填歌词不再报红(修):以前缺歌词会把节点标成「失败」、飘一行动红字(看着像软件坏了),现在改成按钮置灰 + 灰字说明缺什么 —— 红色只留给真故障(引擎报错、网络失败)。
- 🧠 显存不足说人话(修):显卡放不下时明确告诉你「这首歌太长,可以精简歌词,或分成两段分别生成」,不再甩一串
CUDA out of memory。
- ▶ 修掉两个「点了不对劲」(修):画布上有多个音乐节点时,点 A 的音频会播成 B 的;同一首点第二次没反应(现在会重新播放)。
- ⏱ 多长算合适(参考):16GB 显卡实测,含重复副歌的一首完整歌词(33 行)能出 2.2 分钟的歌;段落各不相同又特别长的歌词,可能提示显存不足,分成两段生成即可。
v6.4.0 2026-09-15 · 语音不再常驻显存 · 训练期间完全静音 · 转场看得见
- 💾 语音不再常驻显存(重要 · 改):以前打开软件就把语音模型(约 2.4GB)加载进显卡常驻 —— 现在默认不加载,第一次点配音时才加载(约 30-60s,有进度提示),之后一直常驻到关软件。机器显存宽裕、想要「一打开就秒读」的,可在「设置 → 秒读模式 → 显存策略」打开「开机自动预热」。
- 🔇 训练期间完全静音(改):训练要独占显卡 —— 现在开训前语音服务自动让出显存,训练中不再有任何语音(炼丹开始/完成/失败的旁白、品控成片点评、新手引导口播都已移除);训练期间点配音会明确提示原因,训练结束后再用即可。
- 🎛 不用再选「用哪个引擎」(改):平时自动用内置 OmniVoice(快,一句约 1 秒),只有带情绪的配音才自动切 IndexTTS2;配音面板顶部仍可指定「这一次」用哪个,并且会记住你的选择。没装 IndexTTS2 也不再踩坑 —— 默认会自动落在能用的那个上。
- 🎧 配音面板大升级(新):顶部引擎选择带 🟢已就绪 / 🔴未启动 与原因;「📚 参考录音库」可挑 / 听 / 删你传过的录音,也能直接导入音频或视频(视频自动分离出声音);选完录音自动识别参考台词;每张声音卡显示用的是哪段录音;底部运行日志(报错标红、自动滚到底)。
- ⚡ 转场看得见、点得着(新):右键片段 → 转场(11 种),两段交界处出现一个可见的转场块(显示「🔀 溶解 0.5s」),双击即可改、时长可调;删掉相邻片段时孤儿转场块自动清理;字幕与配音会跟着转场自动校正位置。
v6.3.0 2026-09-13 · 剪辑页焕新:属性抽屉撤销 · 右键菜单终稿 · 配音面板重做 · 画面裁剪拖框 · 字幕/工具条/回到开头
- 🖱 片段功能都收进右键菜单(改):右侧那条属性抽屉撤销了 —— 变速、音量与淡入淡出、画面裁剪、分离音频、识别字幕、画中画,全部回到 右键点片段 的菜单里,一步可达;不再需要多开一块面板。
- 🪄 右键菜单收拾干净(新):去掉了全部小图标和括号说明,文案就是最短的话(分离音频 / 音量与淡入淡出 / 慢放 0.5x / 超快 2x …);配色跟着主题走 —— 亮色主题自动变亮色,不再是"一块钉子户深色"。
- 🖼 图片片段也有话好好说(新):图片没有音轨、也没有语音 —— 以前点「分离音频 / 识别字幕」没反应,现在会明确提示「图片片段没有音轨,无需分离」,不再让人以为软件卡了。
- 🎙 配音面板重做(新):像剪映一样选声音 —— 声音卡片一字排开,点卡片选用、点 ▶ 试听、选中的带 ✓;面板加宽到 680px,台词区更大,情绪改成干净的文字按钮(去掉小表情)。
- ✂️ 画面裁剪改成拖框(重做):右键「画面裁剪」→ 直接在预览画面上拖:框外变暗、亮边框带三分线、四角把手拉大小(可锁 9:16 / 1:1 等比例)、框内拖动挪位置;顶部一排比例按钮(自由 / 9:16 / 16:9 / 1:1 / 4:3 / 3:4),✓ 应用 / ✕ 取消,Esc 也能退。原来右侧那个裁剪抽屉撤销了。裁下来的画面导出时自动放大铺满成片。
- 👁 裁剪实时预览(新):裁剪应用后预览画面立刻变成裁剪后的样子(裁掉的部分不再显示,剩下的自动放大铺满,两侧按需补黑边)—— 和导出成片一个效果,不用导出才知道结果。重置或重新拖框随时调整。
- 🔤 时间线工具条文字化(改):撤销 / 重做 / 分割 / 删除不再是 ↶↷✂🗑 一排小字符(垃圾桶还是个 emoji),现在直接是文字按钮;播放键圆形按钮和缩放控件的颜色跟着主题走,换哪套主题都协调。
- ✏️ 编辑字幕面板重做(新):加宽一倍,台词区更大;字号改滑杆 + 数字(0 = 自动);颜色色板选中带 ✓;位置 / 底块一行排开;按钮加大。
- ⏮ 工具条加「回到开头」(新):撤销旁边多一个回到开头,点一下播放头立刻回 0,不用手拖播放头。
- 🧹 主页面更清爽:左素材 · 上视频 · 下轨道:没有多余的抽屉 —— 左素材栏(520px)、上视频、下轨道,整个剪辑页一眼看全、右键即得。
v6.2.0 2026-09-12 · 剪辑页定稿:素材栏常驻左侧并加宽(520px);片段功能全收进右键菜单(去图标 · 去说明 · 配色随主题)
- 📥 素材栏加宽并回到常驻(改):素材库回到左侧常驻一栏(不再滑出盖住视频),宽度从 300px 加到 520px —— 每行能放下 3 个素材卡,缩略图更大、一眼看清是什么。顶栏「素材」按钮仍可收起,收起后视频区与轨道区随之变宽。把视频 / 图片直接拖进窗口也能导入(拖到哪儿都算,落到轨道末尾)。
- 🖱 片段功能都收进右键菜单(改):右侧那条属性抽屉撤销了 —— 变速、音量与淡入淡出、画面裁剪、分离音频、识别字幕、画中画,全部回到 右键点片段 的菜单里,一步可达;不再需要多开一块面板。
- 🪄 右键菜单收拾干净(新):去掉了全部小图标和括号说明,文案就是最短的话(分离音频 / 音量与淡入淡出 / 慢放 0.5x / 超快 2x …);配色跟着主题走 —— 亮色主题自动变亮色,不再是"一块钉子户深色"。
- 🖼 图片片段也有话好好说(新):图片没有音轨、也没有语音 —— 以前点「分离音频 / 识别字幕」没反应,现在会明确提示「图片片段没有音轨,无需分离」,不再让人以为软件卡了。
- 🎙 配音面板重做(新):像剪映一样选声音 —— 声音卡片一字排开,点卡片选用、点 ▶ 试听、选中的带 ✓;面板加宽到 680px,台词区更大,情绪改成干净的文字按钮(去掉小表情)。
- ✂️ 画面裁剪改成拖框(重做):右键「画面裁剪」→ 直接在预览画面上拖:框外变暗、亮边框带三分线、四角把手拉大小(可锁 9:16 / 1:1 等比例)、框内拖动挪位置;顶部一排比例按钮(自由 / 9:16 / 16:9 / 1:1 / 4:3 / 3:4),✓ 应用 / ✕ 取消,Esc 也能退。原来右侧那个裁剪抽屉撤销了。裁下来的画面导出时自动放大铺满成片。
- 👁 裁剪实时预览(新):裁剪应用后预览画面立刻变成裁剪后的样子(裁掉的部分不再显示,剩下的自动放大铺满,两侧按需补黑边)—— 和导出成片一个效果,不用导出才知道结果。重置或重新拖框随时调整。
- 🔤 时间线工具条文字化(改):撤销 / 重做 / 分割 / 删除不再是 ↶↷✂🗑 一排小字符(垃圾桶还是个 emoji),现在直接是文字按钮;播放键圆形按钮和缩放控件的颜色跟着主题走,换哪套主题都协调。
- ✏️ 编辑字幕面板重做(新):加宽一倍,台词区更大;字号改滑杆 + 数字(0 = 自动);颜色色板选中带 ✓;位置 / 底块一行排开;按钮加大。
- ⏮ 工具条加「回到开头」(新):撤销旁边多一个回到开头,点一下播放头立刻回 0,不用手拖播放头。
- 🧹 主页面更清爽:左素材 · 上视频 · 下轨道:没有多余的抽屉 —— 左素材栏(520px)、上视频、下轨道,整个剪辑页一眼看全、右键即得。
- ⋯ 画面右上角只留一个点:以前那里挤着 7 个按钮(比例 · 影院 · 弹出 · 三分线 | 最小化 · 最大化 · 全屏),现在收成一个 ⋯,点开就是画布比例(16:9 / 9:16 / 1:1 / 4:3 / 3:4)、三分线、影院模式、弹出独立窗口、最小化 / 最大化·还原 / 全屏,点完自动收起。画面更干净,功能一个没少。
- 🔧 修复:影院模式下底部的比例下拉是"裸按钮":它的样式此前缺失,已补上。
v6.1.0 2026-09-12 · 预览区成型:画布比例 · 影院模式 · 独立预览窗口 · 顶栏精简 · 轨道多选
- 🖼️ 画布比例(重要升级):预览区右上角常驻比例下拉,给 16:9 / 9:16 / 1:1 / 4:3 / 3:4 五种。切完画面立刻按这个比例呈现(框外那圈黑就是成片里会有的黑边),真正的所见即所得——先前只有一圈虚线参考框,切了「看着没啥变化」,要到导出才知道变没变。
- 🎬 影院模式(新):一键把预览画面铺满整个窗口(素材面板与时间线让位),专心看片或给人看片时用,按 Esc 退出。顺带修掉「最大化之后画面没变大」的真正原因——预览区高度以前存的是像素、拖过一次分隔条就被钉死,现在跟着窗口一起变。
- 🪟 独立预览窗口(新):把预览画面弹成一个单独窗口,能拖到第二块屏幕、边剪边看。它与主窗口共用同一份播放头(这边一播那边跟着播,不会各播各的),在弹窗里点画面或按空格即可播放/暂停,切换比例、换画面都会同步过去;按 Esc 或右上角 ✕ 关闭。
- 🧹 界面更清爽:剪辑页顶栏右上角只留 素材 · 项目 · 导出 · ⋯。窗口按钮(最小化 / 最大化·还原 / 全屏)连同「影院 / 弹出 / 三分线」一起搬到画面右上角一条工具组里,按「比例 | 画面显示 | 窗口」分组,平时半透明、鼠标移进画面才变亮;两个下拉菜单也去掉了小图标与说明文字,只留功能名。左上角「天使剪辑 Pro」点开可直达快捷键一览 / 设置 / 返回工作台。
- 🎯 轨道多选(新):Ctrl 点选加选 / 减选、Shift 点选一次选中一段范围、Ctrl+A 全选;选中多段后 Delete 批量删除、Ctrl+C 批量复制,预览区左上角会提示已选几段。此前在轨道上怎么按都只能选中一个。
- 🔧 修复:剪切粘贴按了没反应:Ctrl+X / Ctrl+V 现已与剪映一致(剪切=内容进剪贴板并从轨道拿走);粘贴位置若已有片段,会自动挪到该轨的第一个空位并给出提示,不再悄无声息。
- 🔧 修复:新建项目后立刻导入素材会失败:以前会提示「轨道还没就绪,请重进项目后再拖素材」;现在新建完即可直接导入。
- 🎙️ 从文件夹批量导入声音(新):声音库里点「📂 从文件夹导入…」选一个文件夹,里面的音频各建一个声音(名字取文件名、同名自动跳过);把装着音频的文件夹拖到根目录的「导入声音库.bat」上也可以。
- 📐 预览三分线改为默认关闭:画布本身就是成片形状了,三分线只是可选的构图辅助,需要时在画面右上角一键打开。
v6.0.3 2026-09-10 · 天使剪辑 Pro 能力大补:快捷键 · 转场 · 字幕样式 · 画中画 · 智能卡点
- ⌨️ 快捷键真正可用(重要修复):此前菜单里列出的 Space / Ctrl+Z / Ctrl+C / Delete 等只是说明文字、实际并没有接线。现已全部接通:Space 播放暂停、Ctrl+Z/Y 撤销重做、Ctrl+C/X/V 复制剪切粘贴、Delete 删除选中、V 分割、← / → 逐帧微调、Ctrl+= / Ctrl+- 时间线缩放、Esc 取消选中。
- 🎞️ 转场 3 → 11 种:除闪黑/闪白外新增溶解、左滑、右滑、上滑、下滑、圆形展开、放大、像素化,段间为真交叉过渡(音频同步淡接,不会丢音)。
- 🅃 字幕样式:字幕与文字可设颜色、字号、位置(顶部/居中/底部)、对齐方式、半透明背景底块——短视频字幕更清晰,导出直接烧进画面。
- 🔊 片段级音量与淡入淡出:右键片段即可调整该片段自己的音量(0–200%)和淡入/淡出秒数,人声与配乐可分别控制;音频轨片段的音量优先于全局配乐滑块。
- 🌊 音频波形:时间线显示真实波形(后端解码峰值,不是装饰图形),卡点剪辑有据可依。
- 🖼️ 画中画 / 叠加层(新):把素材拖到主轨之外的视频轨即成叠加层,右键「画中画 / 叠加设置」可调位置(5 向)、大小、透明度——做反应镜、logo、分屏都可以。
- ⚡ 智能卡点成片(新):自动分析配乐节拍(识别 BPM),把素材按节拍逐段铺满主轨(素材不够自动循环),一键做出卡点视频。
- 📤 导出升级:清晰度可选 720p / 1080p / 1440p;新增发布平台预设(抖音·快手 / 视频号 / 小红书竖屏、B站·YouTube 横屏),一键设好比例与清晰度。
- 🔍 素材库搜索与筛选:素材多了可按名字搜索、按视频 / 图片 / 音频筛选。
- 🧹 界面整理,各归各位:「更多」菜单瘦身一半(导出设置与快捷键说明都搬走了);点「导出」弹出导出面板——先看到成片信息(时长 / 段数 / 输出规格 / 预计体积)再决定怎么出,底部还有「导出并发布」直接带走;快捷键搬进「设置」(设置页新增「⌨️ 天使剪辑 Pro 快捷键」);顶栏去掉了重复的时间码。
- ⌨️ 修复:按空格没反应:此前剪辑时按空格播放/暂停不生效(内部两套快捷键撞车、相互抵消)。现已修好:一次空格 = 播放,再按 = 暂停;焦点停在按钮上也不会误触发那个按钮。顺带把顶栏重复的「回到开头 / 播放」两个按钮去掉了——点一下预览区就能播,时间线自带标尺。
- 🗂️ 素材面板可收起 + 多选批量:顶栏点「素材」可收起,时间线立刻占满整宽(素材多时更好看);Ctrl 加选 / Shift 选一段 / 一键全选,选够两个就出现「接到轨道」与「移除」——批量接轨按顺序铺好,批量移除只确认一次。
- 🎙️ 声音库(新):在剪辑页就能建自己的声音——选一段自己的录音、起个名字、试听满意后,字幕配音直接用;像剪映的声音库那样。入口在「更多」菜单与配音对话框里。
- 🎙️ 修复:自己建的声音"听起来没变":此前声音库里建的音色卡,配音时会悄悄退回默认声线(所以听着跟没建一样)。现已修好——参考录音对应的台词由本地语音识别自动补上(离线、第一次约 1~2 秒,之后走缓存),选谁的声音就是谁的声音。
- ✂️ 画面裁剪(新):右键视频/图片片段可把画面裁成 9:16 / 16:9 / 1:1 / 4:3 等比例,并选择保留哪一块(居中 / 偏左 / 偏右…)——横屏录屏裁竖屏就靠它。
- 比例参考框(新):预览区按导出比例画出成片边界 + 三分线、框外压暗,构图和字幕位置一眼有谱;右上角可随时开关。
- 🎙️ 字幕配音(新):右键任意字幕即可为这条配音——自动带上这句台词、落到它的时间位置,并自动调速刚好铺满这条字幕(不会挤到下一条);「更多」菜单里还有「字幕一键配音」,整轨字幕逐条配好、各自对齐,带进度显示。音色用素材库的音色卡,与画布配音节点是同一套声音。
- 🔊 音频轨支持多段混音(重要修复):此前音频轨只导出第一段——放两段配乐、或给多条字幕配音时,第二段起听不到;同时修掉了部分启动方式下配音根本没声音的疑难问题。
v6.0.2 2026-09-10 · 天使剪辑 Pro · 项目草稿箱 · 成片闭环(内测迭代)
- 🎬 剪辑模块更名「天使剪辑 Pro」:主页特性、模式入口、编辑器顶栏、导出文件名统一换新,气质拉满;功能与数据无缝延续。
- 🗂️ 项目草稿箱(剪映式,新):进入剪辑先看到项目列表——卡片带封面缩略图 / 片段数 / 更新时间,点开直接续剪;编辑内容自动保存,关掉软件、重启电脑都不丢;支持新建 / 重命名 / 删除项目;编辑器顶栏常显当前项目名,点名字即可改名,多项目下不再剪错对象。
- 🅃 导出烧录标题:文字轨的标题/正文现在会真正烧进成片画面(居中大字,字号与颜色跟随片段设置)——此前只在预览可见、导出后消失。
- 📥 导入体验升级:大文件导入显示逐文件进度(配合素材面板「导入中…」提示),不再像卡住不动;拖文件到时间线可直接入库并落到对应轨道;素材缩略图改用归档副本,移动或删除原文件也不会破图。
- 🚀 剪 → 发一条龙:导出完成后点「去发布」自动把成片带到多平台发布页(同一会话多次导出都生效);缺少 Python 环境包时给出明确的安装指引,不再只报一句路径。
- 🛠️ 稳定性与体验:修复项目列表页编辑器控件透出、提示文字重叠的层级问题;素材移除/归档/重启恢复全链路回归通过。
v6.0.1 2026-09-09 · AI 助手全面升级 · 监控 AI 诊断回归 · 初级炼丹师回归 · 剪辑成片增强(内测迭代)
- 🤖 炼丹页 AI 助手换装:入口整体换为「问 AI」问答抽屉——只解答、不代改配置的顾问定位;常见问题(显存/分辨率/rank/打标/Loss 等)本地 FAQ 秒答,没网也能用;云端问答自动附带本机实况(显卡显存、当前参数、数据集、实时 Step/Loss、最近日志),答的就是这台机器的实况。
- ⚡ 流式输出 + 快答/深思开关:云端回答逐字上屏,可随时停止;快答(默认,秒级)与深思(更准但慢)自由切换;修复快答模式下推理模型「思考吃光 token 什么都不答」的问题。
- 🧾 诊断上下文摘要卡:问答抽屉顶部一眼看到 AI 依据了哪些本机数据,点标题可展开完整原文并一键复制——售后求助直接发诊断信息。
- 🩺 监控页「AI 诊断」回归并升级:日志工具栏一键唤起 AI 助手,自动带入最近报错;同一抽屉内可切到「Agent 天使深度修复」(自动带上下文);AI 建议的参数修复支持一键应用(预览 + 二次确认 + 可撤销,绝不静默改配置)。
- 🧪 初级炼丹师回归:首页「初级炼丹」直达三步向导——选模型 → 选数据集 → 开始训练,参数按模型档位与显存自动配好,小白第一次开训即可稳定出 LoRA。
- 🎬 剪辑成片增强:图文成片(文案→逐句配音+图片铺轨+字幕对齐);素材库导入自动归档、重启不丢、可移除;「一键成片」升级为模板成片(快闪/标准/慢节奏 + 开头标题 + 配乐)。
- 🎵 内置免版权音乐库:内置 3 首可商用配乐(CC BY,署名信息见关于页),支持使用本机自己的音乐。
- 🛠️ 稳定性:修复画布出图/成片完成后需拖动才刷新的问题;剪辑页时间线在浅色主题下的显示修正。
v6.0.0 2026-09-07 · 品牌升级:Agent 天使 · 任务中心 · 画布体验全面打磨
- ✨ 品牌升级:「LoRA训练天使」正式更名为 Agent 天使——产品早已不止 LoRA 训练:Agent 智能体、无限画布、ComfyUI 工作流、多平台发布一站到底。所有功能、激活授权、历史数据无缝延续(数据目录保持不变,老版本覆盖安装即升级)。
- 📋 任务中心(新):顶栏右上角 ≣ 按钮,生成任务与 AI 助手操作记录统一时间线——每条带状态(完成/失败/取消)、耗时、时间戳;失败条目一键 ↻ 重跑;支持「全部 / 失败 / Agent」过滤;历史持久化保存(最多 200 条),重启不丢。
- ✦ 工具单按钮 popover:左侧常驻节点库条收进星星按钮——点一下向上展开菜单(文本/图片/视频节点可拖、素材库、工作流),再点星星才收起(点空白/Esc 不误收,方便长时间挂着用)。
- 📟 系统监控改 DSH 风迷你圆环:顶栏一排小符号——显存环 + 内存环 + 温度,圆环弧长即占用比例(>85% 黄 / >95% 红);鼠标悬停看完整详情;释放内存/显存收进右上角图标按钮。
- 🖼️ 拖图进画布即建节点:从资源管理器拖图片/视频到画布空白处,自动创建对应节点并秒显预览(后台自动托管到 ComfyUI);素材库图片支持点击放大预览、一键打开文件所在位置。
- 🎛️ 节点参数 Inspector:选中节点右侧浮出参数抽屉(比例/分辨率/张数/种子/高级参数),节点本体只留「工作流 + 出图」两个核心元素,提示词框自适应高度(1~10 行自动撑高)。
- 🛠️ 稳定性修复:修复节点首帧显示为纯色块、需拖动才重绘的 GPU 合成问题;修复拖入图片到工作流无响应;AI 助手抽屉可拖拽调宽并记忆。
- 🔗 画布工作流真闭环:文本 → 图片 → 视频三节点全链路真出图/真出片实测打通。首尾帧视频模板修复(V3 节点兼容、注意力补丁可旁路),尾帧未上传时自动复用首帧画面(成片消息会如实注明)。
- 🎨 接入 LoRA(全工作流):任何文生图/图生视频工作流的节点参数里都能选 LoRA——下拉候选就是本机
models\loras 全部文件(含自行训练的),带强度调节;工作流原本没有 LoRA 节点的会自动接入模型链。
- 🎞️ LTX 2.3 图生视频复活:22B 模板全链路修复(模型路径、文本编码器、蒸馏加速 LoRA 换用本机等价版等),零下载实测真出片。
- 🗂️ 画布工作流精选分类:选择器按「文生图 / 图生图 / 超分高清 / 智能改图 / 局部重绘 / 扩图 / 多角度 / 三视图 / 文生视频 / 图生视频(首尾帧·全能参考·数字人)」分组展示,只列常用精选。
- 📊 系统监控节点(新):画布可常驻一块实时面板,显示 GPU 显存/温度、内存、CPU、磁盘;顶部「运行全部」左旁新增资源胶囊(负载色点绿/黄/红),点击即在画布插入监控节点。
- 💾 保存 / 导入重做:保存项目改为弹出文件对话框存
.json(路径自己选,同时保留自动恢复);导入改为直接弹文件选择器,覆盖前二次确认。
- 🎛️ 画布设置面板:点左上角标题直接展开全部设置(不再两级菜单);新增「显示节点库」「显示小地图」两个视图开关(默认开,选择记忆)。
- 🖼️ 首尾帧卡与拖拽入图:图生视频节点按「首帧图 / 尾帧图」显示缩略图卡——点图全屏预览、按槽上传/替换,尾帧空着时标注「自动复用首帧」;拖一张本地图到节点上即自动入槽(修复了拖图误弹文件选择框的问题)。
- 🎚️ 关键参数直调:视频节点面板内联「时长(秒)」「分辨率(MP)」数字框,改动即时生效不用开抽屉。
- 📝 提示词框放大:图片/视频节点提示词框加高,右下角 ⤢ 可弹出全屏大输入框(长提示词友好,实时同步)。
- 🐱 Anima 文生图就绪:Anima 底模/文本编码器已适配(模型就位即跑,顾客机可一键下载),未选 LoRA 时占位槽自动旁路不再报错。
- 🔍 模板体检更诚实:模板预设 LoRA 缺失现在会如实报缺(此前只查底模,出现「体检 ready 点了报错」);Qwen Edit 2511 加速 LoRA 已核实官方源收录为一键下载。
- ✨ 细节:AI 悬浮球拖动位置记忆;鼠标手电筒(照到的地方真实提亮、径向渐隐);节点库恢复左侧居中。
- ⚠️ 诚实提示:LTX 2.3 出片约 10 分钟(22B 模型较大);部分精选工作流需按提示补装底模(面板一键下载);系统监控的 GPU/温度/磁盘行依赖本机驱动与系统工具,读不到时该行自动隐藏。
v5.9.0 2026-09-03 · 天使剪辑 · Angel 无限画布 · Angel 多平台发布 · 首次启动大主页
- 🎬 天使剪辑(新模块):顶栏新增「天使剪辑」大主页,剪映式四合一——截取(保留片段/去片头尾,快/精两种模式)、裁剪(9:16/16:9/1:1/3:4/4:3,裁剪/补边/拉伸)、转码(CRF 画质档 + 格式转换)、拼接(可选淡入淡出)。复用内置 imageio-ffmpeg,视频预览 + 结果卡片直出。
- 🖼️ Angel 无限画布:CanvasStudio 上线,36 个内置模板(文生图/图生图/视频),本地 ComfyUI 工作流与 MiniMax H3 云端视频双通道。
- 📤 Angel 多平台发布:B站 / 抖音 / 小红书 / 快手 / 视频号 / YouTube 六平台视频发布;含 B站分区映射、YouTube 标题超长截断、半自动模式(内容填好停在发布前,由顾客确认最后一下)。
- 🚀 首次启动大主页:首次安装打开先看到七模块导览页,进入工作台后持久记忆,此后直达工作台。
- 🧰 稳定性:模型目录表补 HunyuanVideo VAE(此前遇到该缺失项无下载入口);修复冒烟测试环境快照式断言;移除主进程从未生效的视频 provider 注册死代码,启动日志不再报错。
- ⚠️ 诚实提示:剪辑依赖 Python 环境包(
python-env.zip 解压到 resources\env\),未装时会提示环境缺失;各平台发布首次使用需本机扫码/授权登录一次;画布云端视频通道需自配 MiniMax API。
v5.8.2 2026-08-26 · GGUF 打标/反推统一到 llama-server.exe · 支持任意 GGUF 模型
- 🚀 GGUF 后端迁移:本地多模态打标/反推(训练集打标 + 天使提示词反推/生成)统一后端从
gguf_caption_server.py(依赖 1.3GB 的 gguf_caption_env)切到原生 llama-server.exe(与「内置试用聊天」共用同一份运行时)。装过 llama.cpp 的顾客(如 D:\LoRAM\llama)可零下载直接复用。
- 🔁 自动回退(B):llama-server 不可用或启动失败会自动回退旧 Python 后端;设置项新增「llama.cpp 目录(可选)」与「强制旧 Python 打标后端」开关,任一显卡/模型不兼容时可一键退回旧方案。
- 🧩 支持任意 GGUF 视觉模型:架构 → mmproj 决策上移桌面端;Qwen3-VL/Qwen3.5-VL 视觉内嵌自动
--no-mmproj,其余自动 -mm。无 mmproj 的 GGUF 也能被列出使用。
- ⚠️ 诚实提示:旧 Python 后端暂未删除(作回退保留);llama-server 对个别架构(尤其 Qwen3.5 thinking 默认行为)的细节差异尚未真机 A/B 验证,当前以自动回退兜底。客户端调用契约零改动。
v5.8.1 2026-08-25 · H3 双引擎对齐 · musubi 同源对账 · 引擎验证状态修正
- 🎯 H3 双引擎均标为已验证(非实验性):MiniMax 分类下「musubi·视频+音频」置顶为 H3 默认训练路线(与竞品 LoRA训练大师5.5 同款、社区已验证可稳定跑通);AI-Toolkit 原生
minimax_h3 路线与 TutuTrainer 同源、均基于 ostris/ai-toolkit 上游、引擎已验证可跑通。H3 面板两条路线均显示绿标(musubi「已跑通」/ ai-toolkit「同源可跑通」),不再标「实验性·未验证」。
- 📄 对外/对内 H3 对账文档:新增
docs/H3_musubi_reconciliation.md,逐功能对账我们 musubi 集成 vs 5.5 的 musubi(同一 AkaneTendo25/minimax-h3 fork,我们提交比 5.5 新 3 天);并确认 ai-toolkit H3 与 TutuTrainer 同源。结论:两条 H3 路线底层引擎均已被竞品证明可跑通,差异只在 App 集成层(H3 参数面板 / TOML 自动生成 / 下载完整性校验防 0xC0000005 / 断点续传+镜像回退 / 反蒸馏适配器一键下载 / 显存提示 / Batch 守卫)。
- ⚠️ 诚实提示:两条路线引擎均已验证可跑通;App 集成层(aitk_backend H3 job 构建 / config_gen TOML / 下载校验 / 面板)尚未在 ≥16GB 显存真机端到端冒烟,建议首次开训前按本机显存做一次真机冒烟。
v5.8.0 2026-08-25 · LLM 回消息模型训练 · 聊天记录一键打标 · 内置试用聊天 · 流程图引导 · H3 上游同步 · H3 ref2va 图参考训练
- 💬 LLM 回消息模型训练:炼丹页新增「LLM 回消息」入口,基于 Qwen2.5-0.5B + Llama-Factory 训练专属回复风格 LoRA,自动合并→转 GGUF→量化 Q4_K_M;训练完成后只保留最终 .gguf,中间产物自动清理。
- 📥 聊天记录一键打标:训练对话框内新增「导入聊天记录」按钮,支持微信/QQ 导出的 txt/csv,填「我的昵称」即自动完成 user/assistant 角色打标、噪声过滤、会话切分并填入训练数据集。
- 🚀 内置试用聊天:训练完成后结果卡片新增「试用聊天」按钮,自动本地启动 llama-server 并加载刚训练好的 GGUF,弹出内嵌聊天页直接体验,关闭后自动停止服务。
- ❓ 新手引导与流程图:对话框新增「怎么用」帮助按钮,内置完整顾客使用流程图;数据集为空时自动显示简化步骤引导。
- 🔄 H3 引擎同步 ai-toolkit 上游(8/23):
minimax_h3 同步 ostris/ai-toolkit main(ref2va 参考重写 / Hidream ref2va 切换 / 对比引导 / 文本嵌入裁剪 / DOP 音频损失修复 / 双采样修复),并保留全部 LoRA天使 定制(双类 Ref2VA、pruned 权重映射、离线 tokenizer/processor、防截断段错误、VAE 显存自适应分块)。
- 🖼️ H3 ref2va 图参考训练接通:图+视频混合训练改用「参考图 → 视频目标」正确路径——参考图经
control_path 按文件名配对、视频作训练目标(旧混合模式把图当 num_frames=1 目标被 H3 的 17:5 VAE 拒绝,正是此前「图+视频训练失败」根因);视频帧数显式 snap 到 17n+5,H3 训练固定 Batch=1。
- 📌 H3 ref2va 说明:当前 ref2va 为「图参考 → 视频目标」;视频作参考图的上游装配(ai-toolkit dataloader
control_video_paths_list)暂未接通,留待后续版本。
- 🔥 H3 双引擎(musubi 原生分支):训练 H3 现新增第二套后端——原生
musubi-tuner 的 AkaneTendo25/minimax-h3 分支(Apache 2.0 开源,随包带 LICENSE),与 AI-Toolkit 版共用 Comfy-Org 重打包权重(同 aitk/models 目录,无需重复下载约 60~177GB)。两套引擎都支持 fl2va / ref2va 分区、音频联合训练、图片模式、固定 24fps、权重精度选择、大显存全 GPU / 逐层卸载;训练页选「MiniMax-H3 (musubi·视频+音频)」即在 musubi 引擎下开训,按模型归属自动分流。
v5.7.0 2026-08-20 · 概念滑杆训练 · 精度恢复适配器 · H3 适配器内置 · H3/LTX 训练修复 · 许可证合规
- 🎚️ 概念滑杆训练(Concept Slider):AI-Toolkit + SD1.5/SDXL 专属新训练模式,训练「属性调节」LoRA,ComfyUI 测图拖动 LoRA 强度即可连续调节(年龄/表情/风格/细节等);无需图片数据集,样本由正/负提示词对动态构造;支持多目标、锚点、
--m 采样预览。
- 🎯 精度恢复适配器(ARA):量化训练可挂载恢复适配器(本地路径或 HF 仓库
user/repo/file.safetensors),拉回量化精度损失;支持 qfloat8|adapter 内联语法。
- 🎛️ H3 反蒸馏适配器随包内置 + 管理器:官方 v1 / ref2va v1 / alpha 三版适配器内置(免联网),H3 面板新增「检查/下载适配器」按钮,多端点下载 + SHA256 校验,训练零联网。
- 🔴 H3 混合训练(图+视频)崩溃修复:混合模式强制 batch=1(图/视频 latent 帧数不同,同 batch 会 shape 崩溃),对齐 TutuTrainer 同源配置。
- 🔴 LTX-2.3 训练修复:num_frames 自动合法化(8n+1:16→9、24→17…,消灭 VAE latent shape mismatch 崩溃);timestep_type 对齐图图改为
weighted(LTX-2.0 保持 sigmoid)。
- H3 训练参数对齐图图:timestep_type=shift、audio_loss_multiplier=1.0、LoRA 忽略 adaln_proj。
- 📜 许可证合规:README/LICENSE 统一为闭源专有声明;About 页更正 ai-toolkit 为 MIT;MiniMax-H3 协议副本 + NOTICE 随包;引擎 NOTICE 修改声明齐全。
v5.6.4 2026-08-19 · 修复 MiniMax-H3 Ref2VA 缓存加载错误 · Caption 预检可忽略
修复
- 修复 H3 Ref2VA 训练加载错误:修复使用 Ref2VA/参考视频模式训练时,AI-Toolkit 未注册 MinimaxH3Ref2VAModel,错误回退到 StableDiffusion 加载器并报 model_index.json 缺失的问题。已有 H3 权重缓存无需删除或重新下载(H3 图+视频/参考图视频训练失败多命中此坑)。
- Caption 预检增加「忽略并继续训练」:开训前 Caption 预检(含触发词前缀合规率)保留不删,但拦截弹窗新增「忽略并继续训练」按钮——检测误报(如手动改过 caption、修改数据集后个别图未对齐)时可一键绕过继续开训;缺失/空 caption 会提示风险但仍允许自担。
v5.6.3 2026-08-19 · 修复所有视频模型音频抽取崩溃(torchcodec 不可用)
修复
- 修复视频模型音频抽取 100% 崩溃:修复开启音频训练(LTX 2.3 / MiniMax-H3 / Wan 等所有 do_audio 视频模型)后报 Could not load libtorchcodec 崩溃的问题——根因是打包的 torchcodec 0.9.1 与项目下载的 FFmpeg 8 不匹配。现已将引擎数据加载器改为 PyAV 解码音频,彻底绕过 torchcodec / FFmpeg 版本耦合,与 caption.py 既有做法一致。
v5.6.2 2026-08-19 · 修复 MiniMax-H3 逐层卸载 device 冲突崩溃
修复
- 修复 H3「逐层卸载」device 冲突崩溃:修复开启「低显存逐层卸载」后训练报 Expected all tensors to be on the same device 崩溃的问题——根因是 H3 后端把「逐层卸载」(权重 bounce,要求激活在 GPU)和「低显存模式」(整模型搬 CPU,激活在 CPU)两个互斥策略错误地同时开启,现已拆开,逐层卸载时激活正确留在 GPU,VAE 仍用完自动搬回 CPU 省显存。
v5.6.1 2026-08-18 · 修复 MiniMax-H3 训练加载崩溃
修复
- 紧急修复 H3 训练 100% 崩溃:修复 H3 权重完整性预检函数漏 import struct / import json 导致的 NameError: name 'struct' is not defined——该 bug 会让所有 H3 训练(fl2va / ref2va / 图片 / 视频 / 混合)在加载 transformer 权重时直接崩溃,5.6.0 的 H3 训练不可用,5.6.1 已彻底修复。
v5.6.0 2026-08-18 · AI-Toolkit 模型逐子目录下载 · MiniMax-H3 混合训练
新增 / 优化
- AI-Toolkit 模型逐子目录下载(告别整仓盲下):AI-Toolkit 库的目录型模型(SD3.5 / Flux 全系 / Qwen-Image / Wan2.1 / HiDream / Ideogram / Flex 等 20 款)从「一键盲下整个仓库」升级为逐个可见、可下、可断点续传的子目录组件——主模型权重 / 文本编码器 / VAE / Tokenizer / 根配置各自独立列出,顾客能看到每部分是什么、约多大、缺哪个下哪个,不必再整仓下载几十上百 GB。根配置组件自动跳过仓库里的 ComfyUI 单文件权重,不白下用不到的大文件。
- MiniMax-H3 混合训练(图片+视频同训一个 LoRA):训练模态新增「混合训练(图+视频)」——同一数据集文件夹里同时放图片和视频,图片学外观/角色/风格、视频学动态/运镜,一次训出一个更全面的 LoRA(视频部分带音频)。与「视频+音频」「图片模式」三态并存,向后兼容。
- 组件化改造稳健性:目录型模型加组件后不会误判为 ComfyUI 拆分模型而被禁用 AI-Toolkit 引擎;组件路径检测对 aitk/models/ 落盘位置正确识别,不误报路径问题。
注意事项
- H3 混合训练为实验性,建议在 ≥24GB 显存真机做 A/B(纯图 / 纯视频 / 混合同 seed 对比)确认效果;AI-Toolkit 目录组件下载需 Gated 仓库先在设置页填 HF Token。
v5.5.0 2026-08-17 · MiniMax-H3 上游四项核心升级 · Ref2Vid 参考图训练开放 · LTX 引擎统一切 AI-Toolkit
新增 / 优化
- MiniMax-H3 上游四项核心改进(质量 / 稳定直接相关):① contrastive guidance loss 默认开启,音画对比引导提升生成质量;② audio loss 修复,修正音频损失取反与条件切分,音画同步更稳;③ max tokens 512 限制,提示词超长自动截断保护不再撑爆;④ Ref2Vid 新训练模式,新增 ref2va 分区支持「参考图→视频+音频」训练。
- Ref2Vid 参考图训练开放(文案与功能一致):H3 分区选择新增 ref2va(参考图→视频+音频)。因 bundled ai-toolkit core 暂不支持视频参考,选项文案已明确标注「视频参考待引擎升级」,避免顾客误以为能传参考视频。
- LTX 引擎统一切 AI-Toolkit(彻底解决 43GB 检查点 OOM):musubi-tuner-ltx2 训练脚本无 CPU offload / blocks_to_swap 等参数,消费级显卡跑 43GB LTX 检查点必崩;现已把 LTX 模型统一收敛到 AI-Toolkit 引擎——标准引擎列表不再展示 LTX、后端 train.py / config_gen.py 自动兜底切 AI-Toolkit、前端专属训练开关显示条件同步。LTX 43GB 检查点再也不会落到 musubi,OOM 被彻底封死。
注意事项
- H3 仅 33B 预量化权重、实验性,需在 ≥24GB 显存真机冒烟确认;LTX 现已统一走 AI-Toolkit,旧 LTX 配置加载时自动切换到 AI-Toolkit 引擎,训练不受影响。
v5.4.5 2026-08-16 · 打标翻译后端可选 · 提示词工作台布局与视觉升级 · 训练页隐藏项折叠
新增 / 优化
- 新增「打标翻译后端」设置:设置页 AI 诊断区新增「打标翻译后端」下拉,可选 本地 API 打标端点 / DeepSeek。默认 DeepSeek;无 Key 时自动回退本地端点,断网也能做汉化 / 优化 / 扩写。诊断类(训练建议 / 质量评估)仍走云端 DeepSeek。
- 提示词工作台布局升级:点图后右侧浮层详情页 + 网格变暗遮罩,不再挤压图片网格、页面状态不丢;点遮罩 / ESC / 收起均可关闭。
- 提示词工作台视觉升级:详情面板加宽、图片区与提示词编辑/阅读区更舒展,提示词作为主角优先展示,减少拥挤感。
- 训练页「隐藏项 / 高级选项」折叠:LTX-2.3 与 AI-Toolkit 的高级开关(正则化 / 图像到视频 / 联合音频 / 音频归一化 / 音频保留音高 / 差分输出保留)默认收起,只露最常用的「自动帧数」「低显存模式」,降低顾客选择焦虑。
- 构建修复:补全 LTX 预设类型字段,npm run build 类型检查全绿。
v5.4.4 2026-08-13 · H3 音画转写验证 · LoRA 融合稳定性修复
新增 / 优化
- H3 视频音画打标实测通过:视频按实际时长约每秒采样,画面描述使用真实时间戳;开启「听觉转写」后以 faster-whisper 写入真实中文台词,不猜环境声或音乐。10 秒带人声视频已验证时间轴覆盖完整、台词可读、三段式结构可直接用于 H3 训练。
- 融合诊断与兼容性增强:不同训练层覆盖范围可正常融合;同名权重形状不一致会明确提示只能合并同一底模架构、同一训练类型的 LoRA;意外退出会展示 stderr 原因,不再只显示 code: 1。
修复
- 修复 LoRA 融合误报"合并失败: true":授权校验成功值此前被错误当成失败信息;现已修正。并统一桥接输出 UTF-8,修复部分 Windows GBK 环境在完成日志包含特殊符号后异常退出的问题。
- 融合界面可读性修复:浅色主题下"使用说明"改为深色高对比文字;重新合并前自动清理旧事件监听,避免重试后重复弹提示。
v5.4.3 2026-08-11 · H3 三段式打标 · 纯翻译 · 转写预检 · 权重精度选择 · 全模型训练保障 · 历史炼丹回顾
新增 / 优化
- 打标·H3 音画三段式(GPT 协助设计):为 MiniMax-H3 视频+音频 LoRA 训练新增专用打标模板,强制输出三段式——
integrated_multimodal_description:(画面段,按真实切镜写 [Shot N],只描述客观可见内容,不猜台词/音效/音乐)、overall_soundscape:(听觉段,由程序后接的音频分析填充)、non_diegetic_music: N/A(永不猜测配乐);系统提示词与输出契约约束"不要在此猜测声音"。配套工作台支持按 I2VA/FL2VA/L2VA/Ref2VA 固定图片角色与槽位、目标时长、视觉分析查看/编辑、角色感知分析、格式校验与自动修复,保留英文成品和中文翻译。
- 全模型、双引擎训练预检:标准引擎与 AI-Toolkit 在缓存及开训前执行运行时检查,覆盖 Musubi、LTX、ACE-Step、sd-scripts 和 AI-Toolkit,提前发现 LyCORIS、Python 模块、DLL/CUDA、入口及磁盘空间故障。
- 训练诊断与阶段展示:细分显存、磁盘、媒体解码、分词器、网络和依赖故障,清楚展示运行时预检、潜变量缓存、文本缓存和正式训练阶段。
- 首页入口调整:快捷入口换为“万卷丹录”和“纳戒藏丹”,任务区域更名为“最近炼丹”。
- 历史炼丹回顾补全:重新打开任务可查看留存采样图、Loss 曲线、诊断、配置、状态和炼丹日记,兼容标准引擎、AI-Toolkit 嵌套目录及旧版采样目录。
- H3 权重精度选择:训练 H3 时可在 int8(约 60GB,≥24GB 显存)/ BF16 剪枝(约 130GB,≥48GB)/ BF16 全量(约 177GB,建议 ≥80GB)三档间自选,按显卡显存权衡速度与质量;UI 实时提示每档体积与显存门槛。
- 打标页「纯翻译」按钮:单图与批量打标新增「纯译英 / 纯译中」,只做语言翻译、不润色、不改原结构,与原有润色按钮区分。
- H3 打标转写预检与文案区分:打标前自动检测 faster-whisper 是否可用,未装直接在 H3 听觉配置区红字提示并给出安装命令;勾选转写后仍无台词时,明确区分「引擎未装 / 模型加载失败 / 真无语音」,不再误导。
修复
- 修复训练总步数超过 200 时进度保存不完整,新增 Loss 增量持久化。
- 修复 AI-Toolkit 递归查找 LoRA 输出与
done 完成状态识别。
- 旧任务仍可读取留存采样文件;未保存过日志的旧任务会生成基础摘要,但不能还原从未落盘的 Loss 点。
v5.4.2 2026-08-11 · 大显存全 GPU 训练模式 · 训练监控版本横幅 · AI 建议视频数据集修复
⚡ 新增
- 大显存「全 GPU 训练」模式:检测到 ≥48GB 显存的显卡(如 RTX PRO 6000 96GB)时,训练 H3 默认开启全 GPU 模式——把 33B transformer、文本编码器、VAE / Audio-VAE 全部常驻显卡,强制关闭低显存策略与逐层卸载,彻底避免 CPU 搬运拖慢。实测可让大显存机器训练速度大幅起飞;也提供手动开关,小显存机器不受影响。
- 训练监控开头打印「版本 + 配置」横幅:每次开训,日志最上方先打印 App 版本、操作系统 / CPU / 显卡型号 / 内存,以及关键训练参数;H3 额外显示 低显存模式 / 逐层卸载 / 全 GPU 模式 的实时开关状态,方便把这段信息直接复制给我远程排查。
🐛 修复
- AI 建议无法识别视频数据集:此前视频数据集在 AI 建议里总显示「0 张」,导致给不出准确判断。现已正确统计视频数量,展示形如「N 张图 + M 个视频」,视频训练数据集也能被 AI 正确评估。
v5.4.1 2026-08-11 · H3 训练极速修复 · 同步上游稳定性补丁
🐛 修复
- H3 训练「GPU 闲置 / CPU 跑满 / 极慢」根治:缓存 latent 阶段视频 VAE 此前被错误锁在 CPU 上编码,导致显卡全程闲置、CPU 占满、每视频约 2 分钟。现已改为缓存阶段强制把 VAE 搬上 GPU 编码,编码完自动搬回 CPU(显存占用不变)。这是顾客反馈卡顿的直接根因修复。
- 同步上游 MiniMax-H3 训练稳定性补丁:adaln 剪枝层 fp32 上转换防溢出、VAE / 音频 VAE 梯度检查点降显存、非剪枝模型加载支持、音频损失 / 对比引导 / 保留损失接线修复。保留 Comfy-Org 重打包权重适配,未引入图像 / I2V 等无关 feature。
✅ 验证说明
- VAE 设备状态已写回归测试(强制上 GPU / 编码后搬回 CPU 均通过)。上游同步部分改动训练行为,请在 ≥24GB 显卡上用你的数据集实跑确认(小步数冒烟测试:loss 正常下降、无 OOM / 段错误即达标)。
v5.4.0 2026-08-10 · ComfyUI 天使启动器大改 · 双模式切换 · 创作工坊卡片化 · 专业图标
✨ 新增
- 顶部「双模式」一键切换:标题栏新增秋叶式双段 pill,一键在「LoRA训练天使 / ComfyUI天使启动器」两套工作区之间切换,各自独立左侧导航,互不干扰。
- 一键创作工坊「MiniMax-H3 式」傻瓜分类:工作流选择器从下拉框改为卡片网格,顶部分类 tab 带数量徽章(全部 / 文生图 / 图生图 / 文生视频 / 图生视频 / 音频 / 超分 / 其他),右侧加搜索框;内置模板从 14 个扩展到 30+,覆盖文生图 / 图生图 / 文生视频 / 图生视频 / 音频 / 超分等全类型。
- 最近使用工作流:自动记录最近使用的 8 个工作流并持久化到 localStorage,跨会话记忆,一眼找回常用流程。
- H3 权重下载「取消」按钮:下载过程中可随时取消;取消残留的 .part 文件下次自动 HTTP Range 断点续传,不会留坏文件。
🎨 优化
- ComfyUI 天使启动器左侧导航大改:原页内「出装创造中心」侧边栏的全部功能(目录直达 / 工作流管理 / LoRA 管理 / 模型下载中心 / 环境维护与安装 / ComfyUI 设置 / 教程与帮助 / 创作中心 / 版本管理)全部迁移到全局左侧导航,分组(ComfyUI 工具 / 快捷入口 / 提示词 / 系统)清晰、可滚动。
- ComfyLaunch 全页 emoji→矢量图标专业化改造:去除页面所有 emoji,统一改用 Element Plus 矢量图标,界面更专业、干净、统一。
- 模型库分类补漏:原生库 SD 系列置顶、与顶部 tab 顺序一致;AI-Toolkit 库补齐 Qwen Image 系列(含 edit_plus)与 Flux 2 Klein 系列,Anima 系列归到 SD 系列。
- H3 权重下载改为流式直连:自写 requests 流式下载,实时显示进度条 / 网速 / ETA;多端点(HF → hf-mirror → huggingface.co)自动换源,下载后校验 safetensors。
🐛 修复
- 音频工作流 autoTest 误判「无输出」:comfyApi.ts 的 extractImages 原本只抓 images/gifs,现支持 audios,音频类工作流不再被误判失败。
- H3 权重下载不显示进度:根因是训练环境 huggingface_hub 1.27.0 移除了 progress_callback,旧逻辑永远静默下载;改为自写流式下载后进度实时显示。
v5.3.0 2026-08-07 · H3 视频提示词页 · 本地 GGUF 直出 · 中文翻译 · Qwen+DeepSeek 级联
✨ 新增
- 「视频提示词 (MiniMax H3)」页面:左侧主导航新增入口,用中文意图生成标准 H3 英文视频提示词(含
integrated_multimodal_description / overall_soundscape / non_diegetic_music 等字段)。
- 五种 H3 模式:T2VA / I2VA / FL2VA / L2VA / Ref2VA,每种模式实时提示所需参考图(首帧 / 尾帧 / 关键帧)数量。
- 多参考图(最多 6 张):拖拽或点击上传,每张可指定角色(首帧 / 尾帧 / 关键帧 / 参考),直接喂给视觉模型理解。
- 直接复用本地 GGUF 视觉模型:自动扫描 workspace/caption_models(如 Qwen3.5-4B_Abliterated [GGUF]),选中即自动启动本地 gguf_caption_server,无需配置 API 端点也能识图。
- 一键「译成中文」:英文 H3 提示词生成后,结果框右上角可一键翻译成中文(保留标签与时间码),方便中文顾客核对。
- 两种生成策略任选:① 视觉模型直出(GGUF/API 直接按 H3 模板输出);② Qwen 看图 + DeepSeek 写 H3(Qwen 反推参考图,DeepSeek 按 H3 模板润色,需配置 DeepSeek API Key)。
🎨 优化
- 主导航精简:左侧只保留「天使启动器 / 反推提示词 / 视频提示词(H3)」三项,「创作中心」移入天使启动器内部快捷入口,界面更清爽。
- GGUF 服务日志不再刷屏:本地 GGUF 视觉模型启动与运行时的内部日志从页面/DevTools 移除,统一进入「监控 → 运行日志」,界面更干净。
- DeepSeek 401 提示更明确:级联策略调用 DeepSeek 时若返回 API Key 无效(401),错误信息会明确提示前往「设置 → DeepSeek」检查 Key,或切换为「视觉模型直出」策略。
- H3 显存提示调整为 ≥16GB:17–21GB 显卡自动开启分层卸载,22GB+ 建议直接整装训练;提示文案与模型描述更准确,避免 23.xGB 用户被误报。
- DeepSeek H3 提示词输出更干净:级联策略(Qwen+DeepSeek)的系统提示词增加完整示例,让 DeepSeek 按 Qwen3.5 视觉模型直出的 H3 模板格式输出;同时增加输出清洗与指令回声检测,自动拦截把格式说明当作提示词返回的情况。
- 参考图支持点击放大预览:H3 提示词页上传的参考图缩略图现在可以点击放大,弹窗支持滚轮缩放、鼠标拖拽平移、重置视图、ESC/点击背景关闭,方便顾客核对图片。
- 视频提示词生成带进度条 + 可取消:H3 提示词页生成时显示进度条(准备 → 反推参考图 / 调用视觉模型 → 写 H3 提示词 → 完成)并实时显示阶段文案;生成过程中可随时点「取消生成」中断,避免顾客干等。
- 训练页分隔条默认隐藏、悬停才显:高级炼丹师左右面板之间的粉色竖线不再常驻,鼠标靠近或拖拽时才出现细线 + 小手柄,保留调宽功能的同时页面更通透干净。
- 「斗宗专属」入口简化:顶部按钮去掉多余的 🔥 装饰,改为干净的「斗宗专属」文字按钮(32px 高),点击打开 LoRA 合并弹窗;非永久版仍显示小锁标。
- 合并 LoRA 弹窗改成大屏豪爽布局:弹窗宽度扩展到 90vw(最大 1180px),左右分栏(左侧配置 / 右侧智能推荐、进度、结果卡片),字段间距、字号、结果卡片全部放大,解决原 620px 弹窗拥挤难受的问题。
🐛 修复
- H3 页彻底不再显示 GGUF 内部日志 / Qwen 提示词原文:本地 GGUF 视觉模型启动日志、llama.cpp 调试行、Qwen 的 system/user 提示词原文(如 "You are a visual description assistant…")不再出现在页面或「监控 → 运行日志」中,仅保留后端控制台记录,顾客界面完全干净。
- 拦截 DeepSeek 级联策略「边想边写」的分析文本:当级联策略返回的 H3 提示词开头是模型思考过程(如 "We need to create a prompt…")而非模板字段时,后端新增思考口吻检测与兜底清洗,命中即提示重试或切换「视觉模型直出」,确保结果框只出现可直接复制的 H3 模板。
v5.2.0 2026-08-07 · 视频听觉打标 · 视频打标风格 · H3 防护与多项修复
✨ 新增
- 视频带声音也能打标(听觉打标):开启后,给视频打标会自动提取音轨并用 faster-whisper 转写语音/台词,生成听感描述段落随打标结果一并返回(默认关,设置项 opt-in)。
- 视频打标风格选择:新增「视频打标风格」下拉(Straightforward 视频 / SD 视频标签 / Wan I2V 专用 / 动作标签),并附格式与要求提示(支持 MP4/MOV/WEBM/MKV,建议分辨率 ≤720p、时长 2–6 秒、主体清晰);原「打标风格」相应改为「图片打标风格」。
- 炼丹页数据集显示主分辨率:数据集下拉列表中,目标数据集直接显示主分辨率(如
1024×1024,混合时 1024×1024 等),方便选训练分辨率。
🎨 优化
- 打标工具主题色统一:打标工具内部页面的按钮主题与设置页一致,跟随主题色自动变化。
- AI-Toolkit 量化护栏:Windows 无 triton 时 FP8 自动回退 INT8(caption 与 ai-toolkit 双引擎),避免量化永远失败、训练无故回退。
- 差分输出保留(DOP)仅 AI-Toolkit 显示:原生引擎(musubi/sd-scripts)无此能力,开关自动隐藏,杜绝「勾了不生效」空壳。
- H3 慢启动提示自动消失:训练真正推进(step>0)后顶部提示横幅自动隐藏,不再遮挡日志。
- 监控页切回不再空白:训练日志落盘 + 主进程回放,切页 / 热重载 / 同会话重启后自动恢复画面与状态。
🐛 修复
- AI-Toolkit 只出一个 LoRA:此前保存间隔误设为总步数、且只保留 1 个,导致轮数 2 只出 1 个 LoRA(文件名=总步数)。现按「每 N 轮存一次」正确换算并保留全部中间 checkpoint;完成提示扫描真实文件而非假设路径。
- MiniMax-H3 打包版「未知模型类型」:仅 AI-Toolkit 的模型(H3)不再回退原生引擎,环境未就绪时灰显并提示解压;backend 引擎不对时给出清晰错误而非「未知模型类型」。
v5.1.1 2026-08-05 · H3 16GB 卡 OOM 修复 · 显存探测补全
🐛 修复
- MiniMax-H3 16GB 小显存卡训练 OOM 修复:此前高级模式未探测显存、逐层卸载默认关闭,导致 16GB 卡整模型上 GPU 而 OOM。现挂载即探测显存,≤24GB 卡自动开启逐层卸载(含开训前强制兜底),16GB 卡峰值约 8–10GB 可跑(需 ≥64GB 内存)。
- H3 面板新增平静显存提示:offload 关闭且显存不足时温和提醒开启,去掉吓人警告条。
🎨 优化
- 训练网络提示平静化:Z-Image 等底模配置离线可自动重组,去掉「建议开魔法」「无法直连 HuggingFace」等吓人文案,改为中性提示。
v5.1.0 2026-08-04 · MiniMax-H3 训练(实验性)
✨ 新增
- MiniMax-H3 视频+音频 LoRA 训练(实验性):接入 ai-toolkit 原生 minimax_h3 扩展,支持 33B 联合视频+音频 DiT 训练(fl2va/ref2va 分区、音频随视频联合训练、固定 24fps)。权重来自 Comfy-Org 重打包(约 60GB),App 内一键检查/下载至工作区 aitk/models;需 ≥24GB 显存(建议 48GB+),标记「实验性·未经真机验证」。
🐛 修复
- GGUF 视频打标不再 500 报错:本地 GGUF 模型(如 Qwen3.5-VL)给视频打标时,单条请求塞入多张帧图会触发 context 溢出错误。现改为逐帧独立单图打标 + 结果自动拼接,每帧只占正常 token 量,彻底规避;每帧失败自动重试,输出
[帧i/N] 分段描述。
- 本地 GGUF 服务上下文上限提升:n_ctx 由 8192 提升至 16384,为大图/多帧预留充足余量。
- GGUF 视频默认抽帧数由 8 降到 4:减少请求次数、更快出结果。
v5.0.0 2026-08-03
✨ 新增 / 优化
- 环境快照与一键还原:一键打包 ComfyUI 插件目录 + 完整 Python 环境为带名快照;还原前自动生成回滚点(零风险),支持逐包重装依赖、命名与删除。
- Python 管理完善:镜像源一键切换、库查找/安装/卸载/列出、本地 .whl 与 requirements 批量安装、App 内 Python 命令行、快照环境对比。
- 特殊安装一键到位:PyTorch / Triton / SageAttention / xFormers / llama-cpp-python 五枚按钮按本机 CUDA 自动选源安装。
- ComfyUI 设置四页签 + 启动预检:性能/网络/高级参数结构化配置自动转启动参数;点启动前静默预检 Python/Git/PyTorch,异常自动拦截并一键修复。
- LoRA 离线元数据 + 创作中心:离线读取 safetensors 元数据(底模/触发词/训练参数),新增创作中心(工作流广场/预设方案/资源市场),修复工作流一键注入。
- 外观主题升级:异火紫改为「支持天使」扫码彩蛋主题、恢复启动器主题选择、浏览器选择、收款码等比缩放。
🐛 修复
- 修复环境面板 Python 解释器识别不一致;安装中断数据自愈兜底(自动归位暂存);监控页二维码打开闪动。
v4.9.1 2026-08-02
✨ 新增 / 优化
- 反推提示词新增本地「扩写」(单张/全部,离线、可还原原始)与「取消」按钮。
- 反推队列跨页面持久化 + 批量反推/扩写进度条。
- 人物抠图模型默认落安装目录内(运行时按需下载,不随包分发)。
- 工作流管理聚焦:插件面板精简、多选合并插件需求、启用态提示、网址安装/更新、新增环境维护模块、启动前环境预检。
v4.9.0 2026-08-02
✨ 新增
- 视频数据集训练支持:正确统计「图片 + 视频」媒体数,统一步数预估。
- 视频处理新增「抽帧(按间隔)」「补帧(帧间插值)」模式。
v4.8.0 2026-08-02 · 反推提示词(代际升级:4.7.0 → 4.8.0)
- 反推提示词(独立页面):左侧全局导航「天使启动器」下新增「反推提示词」子项,点击进入独立专业工作台,专注「把图片反推成提示词 / 扩写提示词」;提示词 · 媒体浏览器右上角亦保留快捷入口。
- 从外部直接拖入图片:文件管理器里的图片可直接拖进应用(全局拖拽遮罩),或拖进页面左侧拖拽区;也支持点击选择、从 ComfyUI
output 一键导入,可多选、可拖整文件夹。
- ComfyUI 式自定义配置:右侧配置面板可按需求填写——视觉模型、任务预设(写实/二次元/中英文详细描述/标签+描述/自定义)、自定义指令(直接写你给模型的需求,可自由改写)、输出语言、增强风格、触发词、质量增强、分辨率、最大长度。完全本地运行,不耗在线额度。
- 单图 / 批量反推 + 本地风格增强(扩写):可「反推这张」或「一键反推全部」;结果可随手编辑,并用内置风格增强做本地扩写包装。每张可「复制 / 存到同目录 .txt」,也能「导出全部 .txt」直接喂训练集。
- 模型搜索引擎支持魔搭社区 (modelscope.cn):联网搜索源新增「魔搭社区」,无魔法用户可直接搜 modelscope.cn 上的 ComfyUI 模型;搜索源下拉移到模式按钮下方,只在点「联网 HuggingFace」后出现,布局更对称。
- 工作流管理:选工作流后自动识别并勾选插件:左侧点选任意工作流,右侧立即自动分析依赖、把识别到的插件勾选为「本次启动将启用」,无需再手动点「自动识别所需插件」。
- 工作流管理:内置节点不再误报缺失:ComfyUI 核心节点(如
SetNode / GetNode / Reroute / MarkdownNote / PrimitiveNode 等)会被自动识别并排除,不再显示「未找到候选插件包」。
- 安装缺失插件后自动刷新勾选:一键/单个安装缺失插件后,自动重新分析并把新识别到的插件勾选进来。
v4.7.0 2026-08-02 · 插件管理体验补全(代际升级:4.6.0 → 4.7.0)
- 缺失节点安装「多下载源 + 自动依赖」:工作流管理 → 右侧「未能识别来源的节点」区,自动查找可安装的 Git 插件包,每个节点可单独安装或「一键安装全部」;内置镜像源下拉(官方直连 / gh-proxy.com / mirror.ghproxy.com / 自定义镜像前缀),解决国内拉取 GitHub 插件慢/失败。新增「自动装依赖」开关(默认开):git clone 成功后若插件带
requirements.txt,自动用 ComfyUI 自带 Python 执行 pip install -r requirements.txt;失败会橙色提示,但不影响「插件已装」成功态。
- 模式管理「默认全部启动」:操作区新增「全选已启用」「全选全部」按钮,免去逐个勾选。
- 钉选常驻保持手动:插件列表每行星标按钮收藏/取消,右侧「常驻插件」区块完整列出所有已钉选插件,避免批量误操作。
- 修复:钉选常驻时弹「An object could not be cloned」警告(Vue 响应式数组直接传 IPC 导致)。
v4.6.0 2026-08-02 · 工作流管理:一键装缺失插件 + 常驻插件(代际升级:4.5.0 → 4.6.0)
- 一键安装缺失插件:工作流管理「未能识别来源的节点」区可「查找这些节点需要安装什么插件」并「一键安装全部缺失插件」,在启动器内 git 克隆安装;每个候选包也可单独安装并实时进度。
- 顾客自钉选常驻插件:在「ComfyUI-Manager 始终保留」之上,新增顾客可钉选的常驻插件——任意模式下都始终启用,不被禁用。插件列表星标即可钉选,右侧区块统一管理。
- 优化:模式管理右栏置底固定操作区(启动按钮始终可见)、顶部 ComfyUI 运行状态条与健康摘要、运行中应用模式提示重启。
v4.5.0 2026-08-01 · 媒体浏览器、打标能力补全与工作流管理(代际升级:4.4.0 → 4.5.0)
- 天使启动器新增「工作流管理」:三栏式(工作流列表 / 插件列表 / 模式管理)。选择工作流后一键「自动识别所需插件」,保存为专属模式;启动时仅启用该模式插件(ComfyUI-Manager 始终保留),其余自动禁用,避免插件冲突拖慢启动。支持手动增删插件、多模式保存与删除。
- 媒体库「提示词」反推支持本地 GGUF:可直接选
workspace/caption_models 里的 GGUF 模型(如 Qwen3.5-4B Abliterated),后端自动拉起本地服务再反推,不再报「不支持 GGUF」。
- 批量工具恢复「视频处理」标签页:分辨率/比例对齐、抽帧/时长统一、首帧导出(I2V 条件图)。
- LoRA 管理匹配 Civitai 资料(TE 启动器同款):递归扫描 ComfyUI
models/lora / models/loras(含子目录),列表即时显示「已匹配 / 无匹配」徽标;匹配后展示名称、版本、底模、触发词、下载量、标签、描述、预览图;支持「重新匹配」和粘贴 Civitai 链接/ID「手动匹配」,结果写入本地缓存。
- 媒体浏览器放大重做:
92vw × 86vh 暗色三栏、图片 file:/// 直读,彻底解决发白/转圈。
- 专家模式自动展开全部高级折叠面板(输出格式 / 批量策略 / 后处理)。
- 修复:WD14 ViT v3 打标(文件夹名不匹配)、反推报
qwen3-vl-4b-abliterated 不存在(单/双 l 拼写 + GGUF 兜底)、打标下拉框去重只读真实模型、标签后处理按实际分隔符生效且权重仅作用于强制包含标签。
v4.4.0 2026-08-01 · 天使启动器四大模块重塑(代际升级:4.3.0 → 4.4.0)
- 模块1 目录直达:一键打开 ComfyUI 根目录 / 工作流 / 插件 / 模型 / LoRA / LoRAs / 输入 / 输出 共 8 个目录。
- 模块2 LoRA 管理:左目录树(lora / loras)+ 右卡片网格,支持备注、标签、Civitai 链接,刷新不丢。
- 模块4 出图图片馆 →「提示词」:左侧出图缩略图、中间大图、右侧直接读 PNG 内嵌的 ComfyUI 提示词与生图参数;集成本地 VLM 反推与提示词扩写。
- 模型管理 → 模型下载中心:点击直接打开搜索引擎弹窗。
v4.3.0 2026-08-01 · 数据集四大工作室体验升级(代际升级:4.2.0 → 4.3.0)
- 全屏工作室 ESC 一键退出 × 4:AI 自动打标 / 批量工具 / 打标工具 / 数据集体检,返回箭头点击死区修复。
- 打标可中途退出并恢复:运行中关掉工作室,再开自动恢复进度 + 运行日志。
- 打标时左侧栏自动折叠,把空间让给图片与日志;打完自动还原。
- 提示词助手图片可视化:改前改后对照、变更绿色高亮。
- 打标工具整合:删冗余 AI 打标 tab,频次统计收进提示词助手。
- 修复:WD14 自定义目录读取失败、标签后处理(查找替换/强制包含/黑名单/权重)后端真正生效。
v4.1.0 2026-07-31 · GGUF GPU 打标真可用 + 提示根治
- GGUF GPU 打标真正可用:基于 llama-cpp-python 引擎(CUDA 12.8 运行时),原生支持 Qwen3.5 / Qwen2.5-VL / Qwen3-VL / MiniCPM-V 等视觉 GGUF 模型本地 GPU 打标,速度远快于 CPU;需配套 .mmproj 视觉投影文件(目录级自动配对)。
- 根治误导性提示:之前「本机不支持 GGUF GPU 打标」实为缺打标环境而非缺显卡。已修正探测逻辑与提示文案,环境就位即正常列出模型;缺环境时给出准确指引(而非模糊报错)。
- 明确环境分发策略:打标环境
gguf_caption_env(约 1.3GB)按设计不随安装包分发,需用户按需单独放置——解压 gguf_caption_env.dist.zip 或复制该文件夹到 resources/gguf_caption_env/ 后重启即可;未放置时可在「打标模型」暂用内置 HF 打标。
- 修复开发模式路径探测:dev 模式下
ggufPythonExe() 增加双候选路径,npm run electron:dev 也能正确定位打标环境,不再误报缺失。
- 显卡兼容说明:RTX 20 / 30 / 40 / 50 系 N 卡(计算能力 ≥ 6.0)均可 GPU 打标;AMD / Intel 核显及低于 sm_60 的老卡不支持此 CUDA 环境。
v4.0.0 2026-07-29 · 语音贯穿全流程 + 体验打磨大版本(代际升级:进入 4.x)
- 药老语音真正"开口":训练开始 / AI 建议 / 品控点评 / 新手引导关键节点主动播报;监控页 AI 诊断、质量评估结论自动念出;新增
speakMarkdown 口播清洗(剥 Markdown 符号、超长自动截断)。
- 炼丹页操作两排布局:第一排 开始训练 / 重置 / 保持;第二排 查看监控(从「更多」移出)/ 保存丹方 / 更多。
- 视觉主次重构:醒目绿色还给"训练引擎(选中)",辅助按钮降 muted,删除多余"环境已就绪"提示与"AI-Toolkit 组件就绪度"面板。
- 引擎 badge 完善:原生补「🧿 LoRA 天使引擎(原生)」、异火补「🌋 异火 · AI-Toolkit 模式」,两种模式状态清晰。
- 初级炼丹新增训练引擎选择:默认智能推荐异火,手动改选后不被覆盖。
- 设置页板块折叠 + 页面加宽:大板块默认可折叠,首屏更清爽;内容区加宽到 960px,减少右侧留白。
- 左侧账号区新增「📖 教程」按钮:位于版本号与「更新」之间,一键重新播放新手引导。
- 新手引导完善:补齐缺失定位目标,找不到时自动跳过;设置页文案与实际 7 步对齐。
- 修复:选 AI-Toolkit 后切页被重置;rembg 抠图完善:报错文案引导 + 重装脚本 + App 内「一键安装 rembg」三态横幅与实时进度。
v3.2.8 2026-07-29 · 药老语音·秒读模式(打开即后台启动,无需点 bat)
- 新增「药老语音·秒读模式」:打开软件即后台自动启动 OmniVoice TTS 服务(默认开启,无需手动点 bat、无黑框),日志统一进监控页「药老语音」标签;模型加载完即秒出声,App 重启/退出都不杀进程,重开继续秒读。
- 修复应用内启动 TTS 报错
ModuleNotFoundError: No module named 'torchaudio'(重要):开发模式路径常量错位导致进程回退到训练环境 python(有 torch 无 torchaudio)。已让 App 强制定位 resources/OmniVoice/py312 venv,与 启动药老语音服务.bat 环境完全一致,PYTHONPATH 指向含 torchaudio 的 py312/Lib/site-packages,实测导入正常。
- 修复 TTS 启动失败「无具体原因」:失败原因持久化并展示(设置页显示真实 stderr,如 ImportError / 路径错误 / GPU 占用;监控页实时滚动药老语音日志);独立后台进程加端口守护 + 8 秒确认,避免静默崩溃。
- 增强
tts_server.py 自愈导入:从脚本位置推导整合包根插入 sys.path,不再依赖调用方环境,药老语音在开发 / 打包任意布局下都能找到 omnivoice。
v3.2.7 2026-07-26 · 新增 AI-Toolkit 引擎(同模型可切引擎)
- 新增第三训练引擎 AI-Toolkit(ostris/ai-toolkit,MIT 开源):在「高级炼丹师」旁新增 异火炼丹 (AI-Toolkit) 标签页,支持 SD1.5 / SDXL / SD3 / Flux.1 / Chroma / Qwen-Image / Krea2 / Z-Image / Anima 等模型切换引擎训练(同模型可在 Musubi / SD-Scripts / AI-Toolkit 间任选)。
- 统一 Python 环境:AI-Toolkit 与主训练环境共用同一个 venv(
python-env.zip 解压到安装目录 resources/env/),torch/diffusers/transformers 依赖一致,安装包体积更小、维护更简单;环境缺失时设置页「环境自检」与训练页引擎下拉都会提示。
- 复用现有训练面板:数据集、显存优化、ComfyUI 测图等天使功能对 AI-Toolkit 引擎同样生效;用户设置的 rank/alpha/学习率/优化器/调度器/轮数 经字段映射真正生效(epochs 自动换算为 AI-Toolkit 的绝对 steps)。
- 引擎源码打包进安装包:
engines/ai-toolkit/ 随 setup.exe 分发;环境包(约数百 MB)独立提供,顾客一键解压即可。
- 修复 Anima 低显存跨设备崩溃(重要):顾客反馈 Anima 开低显存报
RuntimeError: Expected all tensors to be on the same device。根因是 sd-scripts 的 --cpu_offload_checkpointing 在 Anima(Qwen 系 DiT)上与检查点 CPU 卸载存在兼容性 bug;v3.2.1 只改了 flag 名、未彻底排除此崩溃,<16GB 卡开低显存仍会崩。现把 Anima 系 + Flux 系列入 SD_SCRIPTS_NO_CPU_OFFLOAD_TYPES,低显存时改用 --fp8_base 量化主模型 + 梯度检查点省显存,彻底避开该 flag,跨设备崩溃消除。顾客实测需重测确认。
v3.2.6 2026-07-26 · 优化 401 错误提示 + API Key 防空格
- 优化触发词推荐 401 错误提示:当 DeepSeek API 返回 401(认证失败)时,不再只显示"API 返回 401",而是解析服务端错误详情 + 给出明确操作指引(检查 Key 是否正确填写/是否过期/复制时是否带入空格)。
- API Key 自动去首尾空格:触发词推荐与 AI 建议两处调用 DeepSeek 时自动
.trim() API Key,避免复制粘贴时带入不可见空格导致认证失败。
v3.2.5 2026-07-26 · 修复 AI 触发词报错 + AI 建议「应用参数」恢复
- 修复「推荐触发词」报错
解析响应失败: Unexpected token:DeepSeek V4 开启思考后 JSON 答案落在 reasoning_content 或被散文包裹,旧解析只认 ```json 围栏。改为在 content 与 reasoning_content 中扫描所有平衡 JSON 对象、优先取含 primary 的触发词,不再报错。
- 修复炼丹页 AI 建议「应用参数」按钮消失:同因——思考模式下
apply JSON 落在 reasoning_content 或散文里,旧解析匹配不到代码块 → 应用按钮隐藏。现已全文检索 JSON(含无围栏/散文包裹),并自动从展示文本剥离原始 JSON 块,只显示可读建议,「应用参数」按钮恢复可用。
- 验证:单元测试 7/7 通过;
vue-tsc + vite build 全绿。
v3.2.4 2026-07-26 · 修复 DeepSeek 诊断全空 + 中小模型大卡极速
- 修复 DeepSeek 诊断类 API 全部返回空(重要):v3.2.1 把训练报错诊断 / 质量评估 / 炼丹页 AI 建议强制改用
deepseek-v4-pro 且开思考,部分账号无 Pro 权限、或推理模型把答案放在 reasoning_content 时前端拿到空 → 弹窗直接关闭、体感"点了啥也没用"。现已统一用设置页所选模型(默认 v4-flash),诊断按模型能力自动开思考;返回解析兜底 content/reasoning_content,三处调用(deepseek 咨询 / AI 建议 / 触发词)均加兜底,杜绝空返回。
- sd-scripts 低显存崩溃的第一层修复(v3.2.1):误传 musubi 专属 flag
--gradient_checkpointing_cpu_offload → 改 sd-scripts 正确参数 --cpu_offload_checkpointing,进程不再因未知参数直接退出。(注意:此步只修 flag 名,未彻底排除跨设备崩溃,详见 v3.2.7。)
- 中小模型(SD1.5/SDXL/SD3/Anima/Lumina/Hunyuan-Image 等)大显存卡极速化:sd-scripts 的
--cpu_offload_checkpointing 改显存感知——16GB+ 整装极速、<16GB 弱卡仍卸载保稳、显存检测不到保守保留。覆盖顾客 8/12/16/24/32GB 各种显卡:小卡稳、大卡快。
v3.2.3 2026-07-26 · 修复 Z-Image(Adapter)在 16GB 卡训练极慢
- 修复 Z-Image(尤其 Adapter)在 16GB 显卡(如 RTX 5080)训练极慢、显存填不满:旧逻辑无条件强制
--gradient_checkpointing_cpu_offload,把反向激活搬 CPU 再搬回 GPU,既吃无谓 PCIe 往返又让显存空着跑不快(实测 ~2s/step)。现已显存感知:Adapter 在 16GB+ 整装极速(不 offload、不重算、0 块交换,显存自然填满,单步预计 <1s);<16GB 小卡自动回退 offload + 少量块交换保稳。完整 DiT 微调 24GB+ 才关 offload。
- 配套建议:Z-Image 训练务必保持 FP8 主模型 + FP8 文本编码器(Ada/Blackwell 张量核心跑 fp8 更快);batch size 调 4–8 喂饱 GPU;存盘点间隔拉大减少中断。
v3.2.2 2026-07-26 · 新增 Chroma 模型 + 修复 5090 慢训
- 新增 Chroma 模型:补齐与 AI Toolkit 的模型覆盖。Chroma(Lodestones,基于 FLUX 架构)与 Flux 共用 VAE + T5-XXL、不需要 CLIP-L;走 sd-scripts 引擎并自动注入
--model_type chroma --apply_t5_attn_mask(脚本硬性要求)。已端到端验证参数正确。
- 修复 Krea2 在 32GB 大显存卡(如 RTX 5090)训练极慢:旧逻辑对 ≥32GB 卡仍强制开启块交换,PCIe 瓶颈导致 5090 跑出 50s+/step(而 5080 仅 7s/step)。现已让 32GB+ 卡整装跑极速、24GB 少量交换、<24GB 才强制保稳交换。
v3.2.1 2026-07-25 · 紧急修复:低显存崩溃 + DeepSeek V4
- 修复「低显存」模式崩溃(重要):所有 sd-scripts 引擎模型(Anima / Flux / Lumina / Hunyuan / SD / SDXL)开启低显存都会因参数名错误直接报错退出。根因是桥接错误传入 musubi 专属 flag
--gradient_checkpointing_cpu_offload,已改为 sd-scripts 正确参数 --cpu_offload_checkpointing。Anima 顾客反馈的崩溃即此问题。
- DeepSeek API 紧急迁移(V4):官方已于 2026-07-24 停用
deepseek-chat / deepseek-reasoner,旧默认模型已失效。默认模型改为 deepseek-v4-flash;训练报错诊断 / 质量评估强制走 deepseek-v4-pro + 思考模式(更准的根因分析);旧配置自动兼容映射,不会崩。
v3.2.0 2026-07-24 · 天使启动器 UI 大改
- 天使 Hero 横幅:宽幅天使图全屏展示,三行标题(一键启动 / 训练·出图·一键闭环 / 专为创作者打造),服务状态 pill + 显存预设 + V 标版本号融入
- ComfyUI 启动器重构:全宽仪表盘布局,去掉左侧导航栏;启动/停止/打开网页三按钮横排 hero card;LoRA 选择框 + 出图按钮上下对称排列
- 模型管理完善:分类筛选、标签/备注编辑、打开目录、下载中心快捷入口;恢复模型管理卡片
- 移除冗余:底部日志终端、模式预设、顶栏品牌区、默认公告提示条
v3.1.13 2026-07-21 · 风格前缀从根上防污染
- 打标「风格前缀」从根上防污染:
photorealistic 选项已彻底移除;后端硬保证:无论配置或旧预设传来什么都按「标准」处理,绝不拼 photorealistic 前缀(解决它永远排在第二位、污染触发词的问题)
- 后端不再追加
masterpiece, best quality 等质量词(训练 caption 里只会污染概念、稀释触发词)
- 对话框新增可见的「风格前缀」开关(默认「标准(不添加)」,带醒目警告),仅风格 LoRA 专用;人物/物体/角色 LoRA 开启会污染触发词,已明确提示不建议
- 旧预设若保存了已移除/非法选项,加载时自动回落「标准」,不会复活污染前缀
v3.1.12 2026-07-20 · Qwen 24/32GB 显存修复
- 修复 Qwen-Image / Qwen-Image-Edit 在 24GB / 32GB 显存卡上仍 OOM:
- 根因:上一版只在 ≤16GB 强制 fp8_vl,但 24/32GB 卡上 7B bf16 文本编码器(约14GB)与 12B DiT 叠加仍超显存 → 缓存文本嵌入(2/3)或训练首步 OOM
- 修复:改为「显存 <48GB(极速门槛)即强制
--fp8_vl」,fp8 下 TE≈7GB,16/24/32GB 均可装下;缓存步与训练步同时生效,缓存落盘仍为 bf16
- 仅 ≥48GB(能整装极速)才用 bf16 文本编码器以保留精度
v3.1.11 2026-07-20 · Qwen 文本编码器 OOM 修复
- 修复 Qwen-Image / Qwen-Image-Edit 在 16GB 显存卡上缓存/训练卡死:
- 根因:7B 文本编码器(Qwen2.5-VL)默认以 bf16 整装 GPU 约 14GB,16GB 卡装不下 → 缓存文本嵌入(2/3)或训练首步 OOM 静默卡死
- 修复:检测到显存 ≤16GB 时自动给 Qwen 强制
--fp8_vl(TE 以 fp8 加载≈7GB,缓存文件仍以 bf16 落盘,训练读取无兼容问题),缓存步与训练步同时生效
- 24GB+ 卡仍用 bf16(不损失精度),行为与之前一致
v3.1.10 2026-07-20 · 打标预览 + Qwen Edit 修复
- 打标预览功能上线:「预览 3 张」按钮现已完全启用
- 随机选择 3 张图片进行打标测试,不会修改实际 caption 文件
- 弹窗展示预览结果,方便在批量打标前验证效果
- 后端新增预览模式支持,只返回结果不写入文件
- Qwen Image Edit 离线训练:修复 Qwen Image Edit Plus 2511 训练报错
- 内置 VL Processor 配置文件到软件中(8 个文件)
- 训练前自动复制到 HuggingFace 缓存目录,无需联网下载
- 支持离线训练 Qwen Image Edit / Edit Plus 2509 / Edit Plus 2511
- 解决 OSError: Can't load image processor 错误
- 文档完善:
- 新增与 AI Toolkit 功能对比文档,说明功能对等性
- 补充省显存开关详细说明(FP8 / 缓存 / 低显存模式的区别)
- 说明各功能的协同工作原理,消除用户对冲突的担心
v3.1.9 2026-07-19 · 对齐 AI Toolkit 省显存选项
- 新增「省显存选项(类似 AI Toolkit)」:在「显存优化」区新增三个顾客熟悉的开关,默认全开:
- 缓存潜变量:latent 存盘,训练时直接读取,省显存 + 每个 step 更快
- 缓存文本嵌入:text encoder 输出存盘,省显存 + 每个 step 更快
- 低显存模式:梯度检查点 CPU 卸载,进一步压低 GPU 显存(同 AI Toolkit 的 low_vram)
- 16GB 跑得稳又快:沿用你本地的可靠路线——块交换(16GB 自动 16)+ Krea2 激活 offload + 梯度检查点;极速只在显存真能整装时才触发(12B 约 48GB / 9B 约 32GB,分辨率越低门槛越低),不再出现「关交换就假死 / 客户 24GB 跑不动」的回归
- 训练日志可见:开训时打印缓存 / 低显存状态,顾客能直观确认当前生效的省显存策略
v3.1.8 2026-07-18 · 多角色 + 极速路线
🎯 多角色 LoRA 训练(融合成一个 LoRA)
- 子文件夹自动展开:多角色数据集(每个角色一个子文件夹)正确展开为多 subset,融合训练成一个 LoRA,caption 触发词区分角色
- N_角色名 平衡:参考秋叶,文件夹名
10_角色名 的数字=该角色重复次数。图少的角色给大数、图多的给小数,自动平衡各角色训练量,避免偏向某一人
- 预览图递归扫描:多角色时训练采样预览图不再被跳过(原先只扫顶层目录,子文件夹里的图取不到)
- 打标时自动规范化:打标前自动检测子文件夹命名,弹窗一键规范为
N_角色名;批量工具 Tab 也加了「一键规范多角色文件夹」按钮
🚀 训练速度优化(极速路线)
- 大显存自动极速(已修正):关闭块交换时,仅当显存真能整装才走极速(12B 模型约需 48GB / 9B 约 32GB / 小模型 16GB,分辨率越低门槛越低)→ 模型整装进 GPU,越训越快(同 AI Toolkit)。否则自动回退自适应块交换保稳,小显卡关交换也不会 OOM。所有模型通用(Krea2 / Qwen-Image / Flux.2 等)
- 小显存保稳(已加强):开启块交换走原自适应路线;即使顾客误关块交换,软件也会按显存自动补上保稳块交换,16GB 等小显卡不再裸奔 OOM
- 简化设置:移除训练模式下拉,顾客只需开关块交换即可,软件自动按显卡选最优
🐛 Bug 修复
- 多角色重命名撞名:两个角色名相同 + 重复次数撞上时会重命名失败,现自动加
_2/_3 后缀
- 空文件夹提示:一键规范时空文件夹红字提示「建议删除」
- 批量重命名占位符校验:命名规则不含
{index} 时提醒(否则自动加后缀避免重名)
🎬 API 打标
- 视频打标:API 模式支持视频(按媒体类型分流 image_url / video_url)
v3.1.7 2026-07-18 · 修复预览 3 张
🎯 预览 3 张(打标预览)
- 修复预览失败:之前「预览 3 张」点击后必然报"预览失败"——后端只把结果以事件流发出、从未同步返回,前端取不到结果。现预览模式会在进程结束后把 3 张结果回传,对话框正常显示
- 预览不污染数据集:预览模式只读取并回传 caption,不再写入 .txt,不会覆盖你原有的打标文件
- 空结果判失败:若 3 张都没打标成功(如未选模型、模型目录缺失),会正确提示失败而非空对话框
📌 说明
- 预览依赖本地打标模型(WD14 / Qwen3-VL 等);API 打标模式下的"预览 3 张"暂走本地 VLM 体验
v3.1.6 2026-07-18 · API 视频打标
🌐 API 打标服务 · 视频支持
- 视频经外部 API 打标:斗宗模式下的 API 打标开关现在支持视频,自动按媒体类型分流——图片发
image_url、视频发 video_url(OpenAI 兼容协议),Ollama 协议走 images 字段
- 不触发本地视频补丁:API 模式下视频不再调用本地 transformers 的
ensure_video_patch,纯外部发送,避免无本地模型时崩溃
- 视频提示词分流:API 模式下的视频使用「视频 user_prompt」(与图片 prompt 区分),自动取
video_user_prompt
- 体验提示:数据集含视频时,点击开始打标会提示"需端点本身支持视频输入(如 OpenAI 官方接口 / 支持视频的兼容服务)"
📌 说明
- 本地整段视频打标仍走 Qwen3-VL(多帧采样);API 模式的视频能力取决于你所接的端点是否支持视频输入
- 音频打标本次未包含——训练引擎为图像/视频 LoRA,暂不涉及音频
v3.1.5 2026-07-18 · 训练队列完善
🚀 训练队列功能完善(核心)
- 彻底修复队列崩溃:重写队列后端,复用与单次训练完全相同的启动协议(stdin 传 JSON job + bridge token 校验),修掉"队列任务一跑就崩"的致命 bug
- 互斥守卫:队列训练与手动训练不能同时跑,避免 GPU 争抢冲突
- 实时进度:队列进度改为主进程实时推送,不再只靠 3 秒轮询
- 崩溃恢复:重启后自动清空卡死的当前任务标记,队列可正常续跑
- 状态正确:暂停/恢复不再误判为 error
🌐 API 打标服务
- 后端补全:Ollama / OpenAI / LM Studio 全兼容,逐张图片 base64 发送并解析返回文字
- UI 隐蔽化:简洁模式不显示 API 选项,仅"斗宗强者"模式可见;设置页收入「高级打标设置」折叠区(默认收起)
- 打标量化默认 FP8:新用户开箱即最快速度,质量几乎无损
🔧 修复
- Wan 2.1 I2V 缓存报错:移除不存在的
--clip_tokenizer 传参(tokenizer 已通过环境变量正确传递)
v3.1.0 2026-07-16
⚡ 显存优化大更新
- Krea2 16GB 可跑:修复 28 层大模型在 5080 等 16GB 卡上显存溢出卡死问题,智能显存调度确保稳定训练
- OOM 哨兵:显存不足时打印中文诊断并干净退出,不再静默卡死
- LyCORIS 支持:新增网络类型选择,支持 LoRA / LoHa / LoKr / DyLoRA
- LoRA+ 学习率:A/B 矩阵差异化学习率,提升收敛质量
- 新默认调度器:cosine_with_min_lr 避免训练末期 loss 反弹
- torch 升级 2.9.1+cu128,Blackwell RTX 50 系原生支持
v3.0.17 2026-07-14
⏸ 训练暂停/恢复 + Krea2 体验修复
- 训练暂停/恢复:监控页训练时显示「⏸ 暂停」按钮,暂停挂起进程(显存保留),再点「▶ 继续」恢复;全链路 IPC + 控制文件轮询
- TE 预检路径修复:改用
resolve_krea2_text_encoder 避免误报缺 TE
- Krea2 FP8:非 musubi 强制,但 bf16 DiT+TE 在 32GB 卡上直接 OOM,强制开 fp8 是最优解
v3.0.16 2026-07-14
🐢 Krea2 训练全链路审计 (3 P0)
- Krea2 Turbo 空路径:model_path 为空时跳过 raw.safetensors fallback,已修复
- 组件缺 role 字段:DiT/TE 补全
role:'model'/'text_encoder'
- toml 缓存字段在 voluptuous 会炸(已回滚):musubi 靠 prepare_for_training 扫描缓存目录自动消费
- 附:显存检测失败时不再静默开启 10 块交换
v3.0.15 2026-07-14
🔥 模型合并双功能上线
- LoRA → 大模型(一键熔合):将 LoRA 熔入底模,一键直出专属大模型,无需挂载,可分发 CivitAI
- LoRA → LoRA(合成新 LoRA):多颗 LoRA 融合成一颗,挂载一颗即得多重效果;默认权重 0.5 防过饱和
- 智能推荐 + 使用说明:自动推荐合并模式(可关闭),每个功能配「📖 使用说明」讲清怎么调
💬 通俗化文案 & 模型识别
- 去玄幻风:标题、按钮、结果卡片改为直白措辞,简介改为悬停提示不占画面
- Krea v2:新增底模类型识别与 CivitAI 分发选项
v3.0.14 2026-07-14
🔒 模型路径与校验修复
- Z-Image TE 选不上:修复前后端双重校验将 Qwen3-VL 结构 TE 误拒的问题
- Qwen-Image VAE 下载源错误:5 个模型的 VAE 下载仓库从 Edit 仓库修正为 Image 主仓库
- split_files 子目录检测:项目域自动检测新增递归搜索,下载后不再报路径不对
📦 模型库上线准备
- 全量清理:删除假 VAE / 错位 ae.safetensors / 异常大 TE,释放约 9.2GB
- 校验矩阵审计:排查全部模型 × 组件内容校验,仅 Z-Image TE 存在歧义已修复
v3.0.13 2026-07-13
🏗 打标页重构
- 下拉选择器:数据集卡片列表改为一行动态工具栏,画廊常驻展开
- 全屏 Lightbox:打标弹窗内点图片进全屏预览,滚轮缩放,左右切换
- 过滤搜索:全部/已打标/未打标/空标 四按钮 + 搜索框实时搜图片名和标签
- 视频时长:视频卡片右下角叠 0:12 格式时长标签
- 清空打标:批量工具新增「🗑 清除打标」TAB,二次确认逐张清空
🔒 模型校验修复
- Krea2 DiT 选不上:修复 Anima DiT 校验误拦 Krea2 模型的问题
- Z-Image TE 验证:新增 Qwen3 TE 内容校验,防 VAE 误命名为 TE
v3.0.12 2026-07-12
🚀 新增 · ComfyUI 测图增强
- 官方模板:Anima / Krea2 基于官方工作流重建分体架构模板
- 自动排列:拓扑分层布局,ComfyUI 打开即整齐
- 全模型审计:检查全部 40+ 模型模板映射
🐛 修复
- Anima VAE 下载:repoDownload 误触发 38GB 全仓库下载,改 repo 只下单文件
- WinError 183:os.rename 改 os.replace + shutil.move
- 丹方阁:品阶光华分级,导入导出恢复
- 数据集:拖拽区可点击浏览,新增打开文件夹
v3.0.11 2026-07-12
🐛 修复 · Anima VAE 智能检测误报
- 内容优先:智能检测不再仅凭文件名命中 Flux ae,必须 encoder.downsamples 结构
- 模型库拦截:天使VAE 中若为 ae.safetensors 重命名,部署时直接提示并拒绝
- 错误说明:区分约320MB Flux ae 与约242MB 官方 Qwen-Image VAE
v3.0.10 2026-07-12
🐛 修复 · Qwen-Image VAE 校验误报
- Comfy 官方格式:正确识别 encoder.downsamples / decoder.upsamples 布局(Comfy-Org 下载的 qwen_image_vae)
- split_files 路径:models/anima/split_files/vae/ 下的 VAE 不再误报无效
v3.0.9 2026-07-12
🐛 修复 · Anima VAE 校验
- VAE 内容校验:不再仅凭文件名 qwen_image_vae.safetensors 判有效,防止 Flux ae.safetensors 误用
- 训练前预检:Anima 开训前校验 VAE 结构,错误时中文提示,避免跑到加载才崩溃
- 模型路径:浏览选择备用模型后正确显示文件名并安装到对应目录
v3.0.8 2026-07-11
⚡ 性能 · 启动与打标页
- 授权缓存:硬件指纹与试用检测缓存,减少重复 IO
- 数据集列表:打标页不再逐条请求图片,列表加载更快
v3.0.7 2026-07-11
🔒 安全 · 试用防重置(不影响正式激活)
- machine.id:HMAC 签名,手改 trialUsed 无效
- 多点存储:注册表 + Local 隐藏文件影子副本
- trial_record:绑定硬件 anchor 并签名
- 兼容:正式激活码 / license.json 不变,旧记录自动迁移
v3.0.6 2026-07-11
✨ 打标 · ComfyUI 写手角色
- 写手角色:38 种风格视角(动漫、摄影、吉卜力、赛博朋克等),替换 system_prompt
- 角色组合:主 + 副角色融合,可调权重
- 视频打标:写手角色支持图片/视频,混数据集可分别应用
- 风格增强:打标后自动包装电影感/摄影级/动漫风等关键词
- 偏好记忆:角色与增强选项本地保存
v3.0.5 2026-07-11
✨ 体验 · 模型库 / 智能检测 / 初级炼丹师
- 模型库清单:HTML 打包检查表,训练页可打开
- 智能检测:进度条 + 搜索文件名展示
- 中央模型库:统一命名,网盘包一键部署
- 初级模式:开训阻塞清单与跳转;显存适配提示(推荐 / 勉强 / 不足)
- 模型获取:缺失时网盘、模型库、在线下载、智能检测并列展示
v3.0.4 2026-07-10
✨ 体验 · 丹方导入导出 / 多处修复
- 丹方导入导出:支持单方导出、全部导出(JSON);可跨设备共享
- 丹录弃丹:炼丹记录可删除,斗破主题
- 中央库硬链接:大模型用硬链接代替复制,节省磁盘
- 数据集打开:修复按钮无反应的 API 名称错误
- ComfyUI 匹配:Z-Image VAE 被误过滤的回归修复
- Loss 曲线:修复响应式问题;监控页默认关闭
- 手动路径:切换页面后不再丢失(localStorage 持久化)
- 智能检测:合并按钮,本地→ComfyUI 回退
- 网盘下载:失败时才显示,成功保持隐藏
- Wan/LTX:解除图片训练限制
- UI 细节:丹方阁黄线归位、冗余标签移除、新手向导删除
v3.0.3 2026-07-10
✨ 数据集 · 批量与识脸
- 打标工具:画廊顶栏精简为 AI 打标 / 批量工具 / 打标工具;统一标签、翻译汉化、提示词助手、视图多选收入「打标工具」
- 自动识脸:裁剪 Tab 支持真人 YuNet、动漫 animeface、动漫高精 anime-face-detector(首次约 246MB)
- 批量缩放:分辨率调整新增最长边 / 最短边等比缩放
- 首页:丹炉状态「斗气池→斗气」「识海→内存」
v3.0.2 2026-07-09
🔧 修复 · Wan 混合精度
- Wan 系列:选 Wan / Wan 2.2 时自动将混合精度设为
fp16(与 Comfy fp16 DiT 权重对齐);切回其他模型恢复 bf16
- 训通保障:Wan DiT 与 mixed_precision 不匹配时提示;训练后端开训前再次校正
- 训完关机:监控页「训完关机」开关;全部训完后 10 分钟强制关机,关开关即可取消
- 训完关机:仅在全部 epoch 完成、最终 LoRA 保存后才执行,不会在第一个 checkpoint 保存时误关机
v3.0.1 2026-07-08
🔧 修复 · Flux VAE 与训通保障不一致
- 组件就绪:ComfyUI 自动匹配、下载检测不再误标「已就绪」;统一走语义校验(Flux 须
flux/ae.safetensors,禁止误用 Z-Image ae)
- 开训按钮:与训通保障对齐,路径语义未通过时按钮保持禁用,避免「看起来就绪却开不了训」
- 路径同步:标准目录检测到 VAE 后写入 config 再校验,避免状态与
vaePath 错位
v3.0.0 2026-07-08 · 第三代里程碑
📊 监控 · 仪表盘模式(本代核心)
- 双视图:标准 / 仪表盘一键切换,偏好本地记住;对齐 lora-scripts-next train_monitor 暗色布局
- 训练总览:进度 Hero、Loss 摘要、步数/耗时/分辨率等统计卡片;GPU 负载、显存、功耗实时展示
- 参数三列:硬件 · 总步数(大字号)· 训练参数并排;Loss / 采样图仪表盘下默认展开、日志区收起(切回标准模式可看训练日记)
- 数据对齐:分辨率跟炼丹页数据集;耗时训练开始/结束自动计时;训练中与完成后均有值
🎨 Anima · 三件套内容识别
- DiT / Qwen3 TE / Qwen-Image VAE:读 safetensors 键名识别,改名或从其他来源下载仍可自动检测与浏览通过
- 自动扫描:
anima/、text_encoders/、vae/、diffusion_models/ 等目录按内容找齐,不限固定文件名
🏺 丹方 · ComfyUI · 多组件校验(2.10 代并入本包)
- 丹方架:高级炼丹保存 / 覆盖架位,首页一键载入;打标 DeepSeek 译英 / 优化
- ComfyUI测图:40+ 模型自动匹配组件路径;训练日记写出图指引
- 路径校验:Flux / Flux2 / Z-Image / Qwen-Image 多组件防串位;开训前训通保障同步
- 自定义训练采样:秘术区可手写采样 prompt,缺参考图 / 未填 prompt 开训前拦截
自 v2.10.x 起累积的功能在本版统一标为第三代;在线更新需本机 < 3.0.0 才会提示升级。
v2.10.5 2026-07-08
🎨 Anima 三件套 · 内容识别
- DiT 主模型:读 safetensors 键名识别
net.* / model.diffusion_model.* 结构,改名或换来源仍可自动检测与浏览通过
- Qwen3 文本编码器:按
model.embed_tokens + model.layers.*.self_attn 结构识别 0.6B TE,排除 VL 多模态与 DiT 权重
- Qwen-Image VAE:按
encoder.down_blocks / decoder.up_blocks 布局或 qwen_image 标记键识别,排除 Flux/Z-Image 的 ae.safetensors
- 自动扫描:在
anima/、text_encoders/、vae/、diffusion_models/ 等目录按内容找齐三件套,不限固定文件名
开发记录;对外发布请以 v3.0.0 为准。
v2.10.4 2026-07-07
⚗️ 炼丹 · 自定义训练采样
- 秘术区:「训练过程采样」下新增「自定义采样提示词」开关(默认关,关=自动读打标)
- 弹窗编辑:开启后弹出大窗手写 prompt;编辑/I2V/Kontext 模型需自行上传参考图
- 训通保障:自定义模式未填 prompt 或缺参考图时开训前提示
v2.10.3 2026-07-07
🧪 炼丹 · 多组件路径校验
- Flux VAE:须
flux/ae.safetensors,不再把 ComfyUI vae/ae 误标为已就绪;ComfyUI 匹配优先 flux 目录
- Flux2 / Z-Image / Qwen-Image:共用文件名统一校验;路径不对显示 ⚠️ 与说明,开训前拦截
- 自动修复:检测后尝试从标准目录 / ComfyUI 找正确组件;训通保障预检同步
🐛 修复
- 炼丹页:修复路径校验改动导致的编译错误,页面无法进入
v2.10.2 2026-07-07
🧪 ComfyUI测图 · 模型自动匹配
- 全模型覆盖:40+ 训练类型统一自动匹配 UNET / CLIP / VAE / Checkpoint;支持 DualCLIP、CLIPVision
- 完整路径:写入 ComfyUI 认的子目录路径(如
Z-image\z_image_bf16.safetensors),修复下拉框空白
- 跨目录搜索:扫描 ComfyUI、workspace/models、设置页自定义路径;找到后硬链接到 ComfyUI 对应目录
- Wan 双 UNET:每个 Loader 只认本节点声明的模型,高低噪声不再串位
📊 训练监控 · ComfyUI 体验
- 不再代启 ComfyUI:移除「尝试启动」;未运行时仅提示,不归咎本软件
- 训练日记:ComfyUI测图步骤与出图指引写入「训练日记」,监控页更整洁
v2.10.1 2026-07-07
📜 丹录 · 品阶与抹除
- 品阶重修:按 totalSteps、产出与 loss 综合评定凡品~帝品;悬停可看说明
- 抹除丹录:炼程纪可删训练记录,可选同步清理 LoRA 产出;炼制中不可删
- 纳戒藏丹:LoRA 列表支持「焚毁」删除;首页链接改为万卷丹录 / 纳戒藏丹
v2.10.0 2026-07-07
🏺 丹方 · 打标 DeepSeek
- 丹方保存:高级炼丹页「保存丹方」→ 首页「丹录」下方丹药架陈列,斗破风格一键载入
- 打标增强:单张打标对话框新增 DeepSeek「译英」「优化」按钮(需设置页 API Key)
- 丹录:LoRA 产出仍保留在历史页双 Tab,侧栏保持 5 项主流程
v2.9.2 2026-07-05
📋 发布同步
- 版本号:全站统一 v2.9.2(package / README / 显存速查 / 部署文档)
- 更新日志:与当前功能对齐,便于打包发布与在线更新识别
v2.9.1 2026-07-05
📜 丹录 · LoRA 收纳
- 侧栏精简:移除「LoRA库」独立导航,恢复 5 项主流程
- 丹录双 Tab:历史页改为「训练任务 | LoRA 产出」,任务与文件同一入口
- 入口:首页丹录「全部 / 产出」、监控页「丹录 · 产出」;旧
/models 自动跳转
v2.9.0 2026-07-05
🧊 LoRA 库 · 发布整理
- LoRA 产出:汇总全部训练 .safetensors,支持搜索、打开位置、Comfy 测图、跳转训练回顾
- 文档:README 与
docs/MODEL-VRAM.md 模型/显存速查表
- 清理:移除临时 backup/lnk;workspace 不再纳入版本库
v2.8.9 2026-07-05
📊 监控页会话恢复
- 重启不空白:打开监控页自动载入最近一次有产出的训练,ComfyUI测图 / 输出目录仍可用
- 空状态增强:无进行中任务时列出最近训练,一点进入回顾
- 丹录 / 历史:新增「查看结果」跳转监控页回顾模式;首页丹录点击改为查看结果,「再炼」单独按钮
- 输出路径:修复历史任务 outputDir 解析(读取 job_config,不再误指 jobs 子目录)
v2.8.8 2026-07-05
📊 监控页布局
- 恢复紧凑布局:去掉监控页下方大块「显卡 / 内存 / 磁盘」卡片(v2.8.3 误加)
- 右上角一行小字:恢复
GPU 10% 41°C 与训练进度并列显示
- 完整 GPU / 显存 / 内存 / 磁盘 → 仍在首页「丹炉状态」查看
v2.8.7 2026-07-05
📁 工作区默认路径
- 修复:打包后默认工作区改回 安装目录\workspace,不再默认 C 盘 AppData
- 旧版兼容:若数据仍在 AppData,首次启动自动迁回安装目录
- 更新保护:NSIS 安装脚本同步保留 workspace(与 env 一样更新不丢)
v2.8.6 2026-07-05
🔧 设置 · 模型搜索路径
- 修复打包后路径锁死:不再强制写入 AppData workspace,留空即使用默认工作区,可正常添加 D 盘等自定义目录
- 说明优化:默认工作区单独展示,「模型搜索路径」仅用于额外目录
🧪 初级 / 高级炼丹师
- 参数隔离:切到高级时自动恢复高级默认(FP8/块交换/AdamW 等),不再被初级预设残留污染
- 保持参数:明确仅高级页生效;初级仍按数据集张数自动算重复次数,开训前独立套用初级预设
- 开训逻辑:初级开训前刷新显存优化;高级不会误用初级 FP8/8bit 配置
v2.8.4 2026-07-04
🛡️ 紧急修复: 更新时 workspace/env 被删除
- NSIS 自定义脚本:卸载前将 workspace/env/output/datasets/jobs/cache/models 移出安装目录,新版本安装后移回
- deleteAppDataOnUninstall: false:禁止卸载时删除 AppData
- 注意:需重新构建安装包(npm run electron:build)后生效
v2.8.3 2026-07-04
🏠 首页全面改版 · 炼丹主题
- 炼丹双入口:🧪 初级炼丹 + ⚗️ 高阶炼丹,取代旧的单按钮「开始训练」,点击自动切换模式
- 焚诀·打标 & 异火·重燃:次级操作命名匹配斗破炼丹世界观
- 📜 丹录:最近训练改为炼丹记录册,含品级评估(凡品/入品/精品/珍品/绝品/废丹)、⏱时长·📐分辨率·步数
- 状态文案统一:成丹/废丹/炼制中/待炼
- 空炉提示:炉火未燃,尚无丹录
🧪 炼丹页优化
- 双模式共用:📥 导入图片 + 🔄 异火·重燃 快捷操作,📋 丹录历史,初级/高级模式共用
- 模式参数传递:首页点击直达炼丹页自动切换对应模式
- 丹录:训练页面新增训练历史,点击载入历史配置,含品级徽章
📊 监控页
- 系统状态卡片化:GPU/显存/内存/磁盘拆分为独立卡片,温度按档位变色+脉冲动画
🖼️ 数据集页
- 提示词修改助手:从单一前缀模式升级为 6 模式(前缀/后缀/查找替换/删除/排序/大小写),含统计概览+搜索过滤+diff 高亮
- 批量工具:比例缩放 pad 模式填充色从黑色改为白色,避免黑边混入训练
- 修复:拖入文件夹导入显示 0 的 Bug
- 工具栏简化:移除冗余按钮(选择文件/选择文件夹/打开文件夹)
📈 监控 Loss 曲线专业级升级
- 健康自适应颜色(学习/收敛/不稳定/发散)、EMA 平滑系数滑块、波动带
- 增强 tooltip、后 25% 训练段标记、导出 PNG、键盘导航
- 后 20% 数据线性回归斜率 · 趋势速率 + 健康 Badge
v2.8.2 2026-07-03
🎨 初级炼丹师页面
- UI 全面美化:居中布局 + 三步引导卡片 + 步骤序号徽章 + 品牌渐变装饰线
- 开始训练按钮升级:渐变背景 + 闪电图标 + 悬浮上移效果
- 数据集统计标签:张数/重复/步数以胶囊标签展示
- 模型描述美化:左侧品牌色竖线 + 背景框
🛡️ 显存优化全面增强
- AdamW8bit 优化器:初级模式自动启用,省约 50% 优化器显存
- GPU 显存检测:自动检测显卡显存,按档位(8/12/16/24/32GB)智能调整块交换数
- FP8 编码器自动开启:T5/Qwen3-VL/Gemma3 等大型编码器自动启用 FP8,额外省 4-9GB
- 显存优化摘要:选模型后显示已自动应用的优化项 + GPU 信息
v2.8.1 2026-07-03
📈 Loss 曲线(监控页)
- 缩放平移:修复数值轴 Step 只能看末尾的问题;支持滚轮缩放、按住拖拽、底部滑块左右拖动
- 工具栏:全览 / 看最新 / 定位最低 / 跟随最新 / 跳转 Step
- 最低 Loss:绿色标记 + 虚线 + 对应采样图文件名
- 长训练:上万步时可把「采样间隔」调到 200 / 500 步看大趋势
v2.8.0 2026-07-03
🔄 在线更新(天使永久版专享)
- 腾讯云 COS:支持从对象存储检查并下载新版本安装包,一键安装重启;workspace 模型/数据集保留
- 权限:仅「天使永久版」可用;年费/月付仍通过作者获取安装包覆盖安装
- 入口:设置 → 在线更新 → 检查更新 / 下载 / 立即安装并重启
🏠 首页
- Banner 纯插画;欢迎语按天使编号;简洁主操作布局;侧栏账号卡与「042号」头像
v2.7.0 2026-07-02
🏠 首页(平民向简洁布局)
- Banner:纯插画展示,不再叠字;品牌与问候移到图下欢迎区
- 欢迎语:按授权显示「欢迎回来,天使042 号」及位次提示
- 主操作:大按钮「开始训练」+「导入图片 / 继续上次」;最近训练仅 3 条,可查看全部
- 训练时长:收成一行轻信息,不占大块卡片
- 侧栏账号:合并为单卡,显示授权类型 / 剩余天数;头像显示「042号」;VX 默认收起为「联系作者」
🐛 训练日志与模型检测
- 误报降噪:正常下载/加载日志不再套【VAE 加载异常】等 scare 文案;仅真失败才翻译标红
- 监控标红:不再因普通 fail 字样误标红;WARNING 单独黄色
- 智能下载路径:识别 Comfy
split_files/vae|text_encoders|… 结构,修复 Wan / Qwen 下载后「重新检测」仍找不到
- 组件路径:一键修复嵌套错误路径(如 dit 与 ae 拼错);Z-Image 任务路径规范化
🎨 界面
- 打标页:深色 / ComfyUI 主题下批量裁剪、重命名文字对比度提升(粉色主题不变)
v2.6.0 2026-07-02
📌 版本号说明
- 自本版起按 2.x 功能版 / 2.x.y 修补版 规范编号;原 v2.0.3–v2.0.14 已对应调整为 v2.1.0–v2.6.0(功能只增不减)
🤖 炼丹页 DeepSeek 咨询
- 入口:模型说明折叠条内
deepseek 输入,居中白底框;输入随字数变宽,发送按钮自适应右移
- 统一 API:移除 FAQ 本地快答,提问一律走 DeepSeek;自动附带训练配置、路径、工作区、报错与最近日志
📺 监控页 AI
- AI 诊断:恢复绿色「AI 诊断」一键分析日志;手动提问占位「输入问题,如:报错」
- 精简:移除日志区上方快捷链接条
🐛 训练与下载修复
- Flux.2 Klein:TE tokenizer 离线/镜像回退;FP8 训练自动补
--fp8_scaled
- Krea 2:Turbo 不可训 LoRA 说明;开训自动查找 Raw 底模
- 模型下载:在线/网盘下载优先保存到设置里的自定义 models 路径
- 监控 ETA:解析 tqdm 的 s/it,修复 0.0s/step 误显示
- 日志误报:HF 401/镜像提示、命令回显不再标红刷屏
🎨 界面
- 选中高亮:粉色主题下模型/分辨率等选中态改为靛蓝,与品牌粉区分
- 输入框:炼丹页 deepseek 白底实线框,修复被全局透明样式覆盖看不见的问题
v2.5.1 2026-07-02
🎨 Anima / waiANIMA 训练修复
- 浏览选底模:DiT 组件支持
waiANIMA_v10Base10.safetensors 等社区文件名,不再报「所选文件无效」
- ComfyUI 权重格式:
model.diffusion_model.* 键名(waiANIMA)与官方 net.*(anima-preview)均可加载训练
- 日志误报:Anima 训练时 VAE 正常加载的 INFO 不再标红为「VAE 加载异常」
- 自动扫描:anima 目录下 waiANIMA 系列文件名纳入检测别名
v2.5.0 2026-07-01
🏷️ Qwen3-VL 专业打标
- 整段视频理解:mp4/webm 整段送入 Qwen3-VL 打标,不再只取首帧
- JoyCaption 式模板:图片/视频分设 system + user 双字段;内置 5 种图片模板、4 种视频模板(含 Wan I2V 专用)
- 预览 / 批量分工:单图/首帧预览用 WD14(秒级);批量默认 Qwen3-VL,含视频时优先 abliterated 版
- 模型列表:移除 Gemma-4B,新增内置
Qwen3-VL-4B-Instruct-abliterated;VLM 权重放 caption_models/ 子目录
- 选中批量打标:图库多选后「AI 打标选中 (N)」,仅处理勾选文件
- 可靠性:生成失败 caption 不再写入 .txt;停止打标后自动 GPU 清理;批量 ETA 估算
🧪 训练页 Caption 预检
- 开训前检查:显示 X/Y 已就绪、缺 caption / 空 caption 数量;未齐时禁用开训并一键跳转打标页
🎨 Anima 底模说明
- 双 DiT 可选:训练页 DiT 组件可浏览选择官方
anima-preview.safetensors 或社区 waiANIMA_v10Base10.safetensors 作底模
- 三件套:无论选哪个 DiT,均需配齐 Qwen3 TE + Qwen-Image VAE;建议 1024 分辨率 + 自然语言 caption
- 改名兼容:三件套均支持内容识别,从其他来源下载、改名后仍可自动检测或浏览通过(不限固定文件名)
v2.4.0 2026-07-01
🎨 ComfyUI测图工作流(全模型)
- 内置官方模板:从 ComfyUI 官方模板同步 SD/Flux/Qwen/Z-Image/Wan/混元/LTX 等 30+ 工作流 JSON
- 一键注入 LoRA:点击「ComfyUI测图」自动 patch LoraLoader 节点、复制 LoRA 到 ComfyUI/models/loras/
- Wan 2.2:双 DiT 高/低噪声链均注入训练 LoRA;生成 runtime 说明文件
v2.3.2 2026-07-01
🎬 Wan 万相视频训练修复
- Wan 2.2 I2V:潜空间缓存与训练不再加载 CLIP(musubi v2_2 架构无需 CLIP);组件列表移除 CLIP 要求
- Wan 2.1 I2V:新增「XLM-RoBERTa Tokenizer」离线组件;开训前自动检测/缓存,潜空间阶段不再联网拉 Hub
- 视频数据集校验:Wan / 混元 / LTX 等视频模型开训前检查目录是否含 mp4/webm 等,图片集不再误开训
- 炼丹页提示:Wan 2.1 I2V 离线清单、Wan 2.2 I2V 说明、视频模型数据集提醒
- 日志翻译:VAE 加载成功不再误报;补充 tokenizer / 0 videos / HF 下载失败提示
📜 授权说明
- 设置页新增正版授权须知与买家 FAQ(激活页保持简洁)
v2.3.1 2026-07-01
🎯 Z-Image 训练修复
- ComfyUI 转格式:训后自动转换按 LoRA 任务名匹配(不再误找
lora*.safetensors)
- Tokenizer 下载路径:修复保存到
zimage/zimage/tokenizer 双层目录;兼容旧路径检测
- Tokenizer 开训校验:独立 role,目录验证不再误报「请选择 .safetensors」
- 离线必备清单:炼丹页 Z-Image 下载区展示全系列共用 / 变体额外文件
- 日志误报:VAE/TE 加载成功的 INFO 不再标红为异常
v2.3.0 2026-07-01
🏷 专业级触发词(第一阶段)
- 数据集绑定:触发词写入
.lora-angel.json,打开数据集 / AI 打标时自动带出
- 应用前预览:批量应用前可查看每张图当前 caption 与应用后差异
- 撤销上次:应用时自动备份至
.caption_backup/,可一键恢复
- 开训校验:已绑定触发词的数据集会检查 caption 前缀合规率,不合规时阻止开训并提示
v2.2.1 2026-07-01
🐛 修复
- 提示词修改助手:修复 API 参数错误导致无法读写 caption(误用
dataset、返回值解析错误);触发词始终正确前缀追加并去重
🔐 激活与授权
- 移除 3 天免费体验:激活页与首次安装向导不再显示试用入口,仅保留机器码 + 正式激活码
🎯 Z-Image 训练
- 训后 LoRA 转 ComfyUI:修复训练完成时 ComfyUI 格式转换未触发的问题(Z-Image / 混元 1.5 等)
v2.2.0 2026-07-01
🎯 Z-Image 离线训练
- Tokenizer 本地化:炼丹页新增「Qwen3 Tokenizer」组件,可下载到设置里的自定义 models 目录(
zimage/tokenizer/),下载一次后 TE 缓存与训练不再联网
- 自动缓存:若未手动下载,开训时会尝试一次性缓存 tokenizer;已有本地目录则直接读取
- Base / DeTurbo / Adapter 三个变体共用
zimage/tokenizer,VAE/TE 也可跨子目录识别
v2.1.2 2026-06-30
🐛 打包环境修复
- 数据集批量工具:修复安装版打开后卡死/整屏空白(裁剪 Tab 函数 ref 无限重渲染);关闭对话框时彻底销毁 DOM
v2.1.1 2026-06-30
🔧 模型下载与训练配置
- Wan 2.1/2.2:DiT 改为 Comfy 仓库实际存在的 fp16 文件名;T5 / CLIP 改
Wan-AI 官方路径,修复下载 404 与开训缺权重
- 混元 Video 1.0:DiT 从错误的
hunyuan_video_dit_bf16 改为 hunyuan_video_t2v_720p_bf16.safetensors(保留 altNames 兼容)
- 全系列审计:LTX 2.0/2.3/IC-V2V、F-Pack、ACE-Step、混元 1.5 对照 HuggingFace 官方仓库,文件名与训练链路确认可用(目录名 ltx/ vs ltx2/ 等差异不影响训练)
- 炼丹页增强 Wan CLIP / 多组件路径识别
📦 环境依赖补全
- easydict(Wan 视频训练必需)纳入 env_check、设置页检测与
scripts/env-extra-requirements.txt
- vector-quantize-pytorch(ACE-Step 必需)、librosa(ACE mp3 可选)同上三处同步
- 打环境包前自动
pip install -r env-extra-requirements.txt(一键打环境包.bat)
📝 说明
- LoRA-Angel 为本地训练软件,暂不支持顾客远程调用开发者 GPU;可代炼 / 云 GPU / 远程桌面等方式另行约定
- 旧安装包用户需同步本版本或重装 python-env 后,再测 Wan / ACE 开训
v2.1.0 2026-06-30
🆕 新功能
- 安装体验:首次安装向导 + 设置页「一键解压 python-env.zip」
- 3 天全功能体验:激活页一键开启(绑定机器码,每台一次)
- 续练 LoRA + 任务模板(角色/画风/视频)+ 过程采样(默认关)
- 打标增强:Danbooru/自然语言/SD 风格/中英切换 + 提示词修改助手(前缀/后缀/查找替换/删除/排序/大小写)
- 训通保障:开训前检查、误配修复、错误中文翻译、ComfyUI 工作流测试
- 训完电源:可选 120 秒后关机或休眠;监控页 ETA/已训时长
- Flux.2 Klein 蒸馏:新增 Klein 9B / Klein 4B(推理向,标记热门);修复缓存阶段
--model_version 遗漏导致训练失败
- Microsoft Lens LoRA 训练:Lens-Base + lens-trainer 引擎、训练页专属分辨率/显存说明、环境检测、
setup_lens_trainer.ps1、ComfyUI 工作流 image_lens_t2i.json
- WD14 快速打标:ViT v2 默认首位,合并进「AI 自动打标」;需 onnxruntime-gpu,模型自动下载到 caption_models
- 批量裁剪 2.0:全屏网格、每图独立拖框;像素截取 / 构图裁剪;像素模式放大预览 + 金色边框
- 数据集:裁剪/缩放后预览实时刷新;AI 打标逐张更新网格;网格打标可滚动、单图对话框全文自动增高
- 监控页:解析 tqdm 的 s/it 与 ETA,修复 0.0s/step 显示;日志区顶/底跳转按钮(AI 诊断栏右侧)
- ComfyUI 联动增强:组件路径持久化、同名模型显示完整路径、按角色精确匹配
🐛 测试反馈修复(炼丹 / 训练)
- Krea 2:Turbo 不可训 LoRA,自动改用 Raw 权重;rank/alpha 锁定 32;512/768 连通性测试分辨率;修复 VAE 误用 anima/zimage 路径
- Boogu-Image:多轮修复架构/FP8/块交换/VAE 加载,可正常跑通缓存与训练
- SD3:clip_l / clip_g 路径与训练闪屏;SD1.5:fp8_base_unet、TE 缓存参数修正
- 模型下载保存到自定义 models 路径(修复落到 workspace 根目录 / krea2 子目录错误)
- LoRA 训练缓存目录跟随设置页工作区,不再硬编码安装包路径
- Flux Kontext 等:修复跨系列 VAE/TE 误配(如 zimage ae 被 Kontext 误用)
- 自定义 models 路径重新检测失效、zimage_de_turbo 有文件却显示未就绪
🐛 测试反馈修复(界面 / 体验)
- 炼丹页切换路由后模型系列 Tab 跳回 Flux → 按已选模型恢复分类 Tab
- 监控 ↔ 炼丹往返后 LoRA 名称变回 my_lora → Pinia 持久化任务名
- 监控日志切换页面回顶 → 记住滚动位置
- 打标触发词重复出现 → 去重逻辑
- 裁剪覆盖原图 Windows Permission denied → 临时文件 + os.replace
- 像素截取裁剪框不显示 → 预览放大、响应式框、图片 complete 补加载
- 炼丹页模型选择区 UI:系列/模型卡片居中、层级强调(B 配色方案)
📦 打包与环境
- 新增
scripts/env-cfg-portable.js:打包前写入便携 pyvenv.cfg,避免硬编码 D:\ 路径
- electron-builder:engines/python_bridge 仅走 extraResources;修复一键打包破坏本地 dev 环境
v2.0.2 2026-06-29
模型检测与 ComfyUI 匹配
- 重新检测仅查本地:用户自定义 models 路径 → 项目 workspace/models,不再偷偷扫 ComfyUI
- ComfyUI 自动匹配独立按钮,与重新检测职责分离
- ComfyUI 改为精确文件名匹配(取消 stem / 正则模糊),避免 DiT、TE、finetune checkpoint 误配
- 多组件就绪时显示来源:自定义路径 / 项目下载 / ComfyUI / 手动选择 / 刚下载
- 重新检测增加 loading 与完成 Toast,路径无效时自动清除并重新扫描
Qwen Image & 下载路径
- Qwen Image Edit 2511 组件 role 与 DiT/TE 路径纠错,修复 TE 缓存误用 DiT 权重
- 模型下载优先保存到设置中的自定义搜索路径(与 externalPath 目录结构一致)
- Electron 侧区分用户自定义 models 根、项目目录与 ComfyUI 扫描范围
v2.0.1 2026-06-28
Ideogram 4 训练完善
- DiT / Qwen3-VL 权重已是 FP8:UI 禁用 FP8 主模型与 FP8 文本编码器,避免二次量化报错
- 块交换恢复可用,上限 33;显存说明合并到顶部卡片,去掉块交换区重复文案
- 选中 Ideogram 4 时 LoRA rank/alpha 自动设为官方推荐 16,切换其他模型恢复默认 4/1
- train.py 忽略 fp8_base,blocks_to_swap 正常传递;专用 ideogram4_shift / lora_ideogram4 参数
Boogu-Image FP8 训练修复
- 默认 DiT 架构对齐官方(40 层 / 3360 维),修复 axes_dim_rope 与 head_dim 不匹配
- 预量化 FP8 权重直接加载,不再二次 --fp8_scaled
- 块交换仅作用于 32 个单流层(有效 0 或 1–30),修复双流混 swap 断言失败
- 修复 enable_gradient_checkpointing 与 diffusers 接口冲突;VAE 改用 flux_utils.load_ae
Wan 万相系列静态审计与修复
- 修复 LoRA 模块误用通用 lora,改为 musubi_tuner.networks.lora_wan(WanAttentionBlock)
- 修复 Wan 2.2 块交换上限误写为 29(1.3B 档),更正为 14B 标准的 39
- 命令拼装验证:--task / --t5 / I2V --clip / 2.2 --dit_high_noise / TE 缓存 --fp8_t5 均正常
ComfyUI 与多组件模型
- 炼丹页支持从 ComfyUI 浏览并选取模型(搜索 + 完整路径,避免同名误选)
- 多组件模型隐藏冗余单路径输入,按角色分配 DiT / 高噪 DiT / VAE / TE / CLIP
v2.0.0 2026-06-27
🎉 重大版本更新 — 新增模型支持 (大规模扩充)
- Flux.2 系列: Flux.2 Dev / Klein Base 9B / Klein Base 4B
- Qwen-Image 扩充: 2512 版本 / Edit Plus 2509 / Edit Plus 2511 / Layered 分层编辑
- 混元系列扩充: Hunyuan 1.5 文生视频 + 图生视频 720P / HunyuanImage 2.1 混元图像
- LTX 视频扩充: LTX 2.0 文生/图生视频 / LTX 2.3 IC-LoRA 视频转视频
- F-Pack: Fun-PAS 视频生成模型
- ACE-Step XL: XL Base / XL SFT / XL Turbo 音乐生成
- Boogu-Image: Base 高精度版 / Base FP8 轻量版
- 其他新模型: HiDream-I1 / Kandinsky 5 / Ideogram 4 / Z-Image Adapter
ComfyUI 联动
- 在设置页配置 ComfyUI 路径后, 炼丹页选择模型组件时可直接从 ComfyUI 已有模型库中选取, 无需重复下载
- 支持自动识别 ComfyUI 下的主模型/VAE/文本编码器/CLIP 等组件, 按目录自动归类填充
模型识别更智能
- 按模型类型限定搜索范围, 避免不同模型之间同名文件混淆 (如 Flux 误选 Z-Image 的 VAE)
- 多级搜索策略: 先精确匹配 → 再按类型目录查找 → 最后深度搜索, 确保找到正确的模型文件
下载更稳定
- 三层下载策略: 优先用本地缓存 → 其次 HF 镜像站 → 最后 HF 官方直连, 自动回退不断线
- 魔法模式: 仅影响训练联网; 在线下载固定智能多源 (镜像→ModelScope→官方), 与开关无关
- 下载进度实时显示: 监控页展示当前文件/百分比/已下载/总大小/速度/剩余时间
监控页优化
- 改为单列全宽布局: 顶部操作栏 → 进度条 → 下载进度 → 全宽日志, 日志区域更大更清晰
- AI 诊断集成到日志标题栏, 操作更便捷
问题修复
- 修复从监控页返回炼丹页后 LoRA 名称被重置的问题
- 修复自定义工作区下缓存文件仍写入默认目录的问题
- 修复 Flux 训练时文本编码器路径映射错误
- 修复模型搜索时跨模型误选 VAE 的问题
- 修复自定义模型目录无法被检测到的问题
- 修复打标时触发词重复出现的问题
- Krea 2 放开 512/768/1024 分辨率选择
- 新增历史任务配置复用: 可从历史炼丹记录恢复全部训练参数
- 新增 GPU 显存一键清理: 智能识别并清理残留的 Python 进程, 不影响其他程序
v1.9.5 2026-06-27
UI 布局全面优化
- 训练页双列布局: 左列=模型选择+数据集+输出设置, 右列=训练参数+显存优化+操作按钮, 全屏不浪费空间, 无需滚动
- 模型选择改为横向标签: 分类一排展示, 点击分类显示该类模型标签, 去掉级联选择器更直观
- 输出名称自动命名: 选择模型后自动生成 my_lora_模型名 格式的 LoRA 名称
- 数据集更简洁: 目标/控制/重复次数一行排列, 分辨率改为 chip 按钮选择, 去掉重复推荐表
- 训练参数不折叠: 所有参数直接显示在右列紧凑网格中, 不需要展开折叠
打标页优化
- 打标内容直接显示: 图片下方直接显示打标文本, 不需要点开对话框才能查看
- 新增"显示/隐藏打标"切换按钮
- 图片网格放大 (140px → 200px), 更好地利用全屏空间
监控页双列布局
- 左列=操作+状态+系统+AI诊断: 整合所有功能面板到左侧
- 右列=训练日志(大): 日志面板占据右侧全部空间, 更大更清晰
设置页
- 新增 ComfyUI 风格主题 (中性深灰配色, 与 ComfyUI 默认外观一致), 设置页可选择三种主题
- 应用启动默认最大化显示
v1.9.4 2026-06-27
musubi-tuner 引擎同步上游 + Ideogram 4 新模型
- 完整接入 Ideogram 4 模型训练: ideogram4/ 核心模块 (34层 single-stream DiT) + 4 个入口脚本 + LoRA 网络
- 同步 trainer_base.py 上游更新: ideogram4_shift / krea2_shift timestep、BlockSwapConfig 封装、save_precision 功能
- 同步 parser_common.py 新参数: --save_precision、--block_swap_h2d_only、--block_swap_ring_size
- 同步 timesteps.py 新增 compute_ideogram4_shift_timestep、train_utils.py 新增 resolve_save_dtype
- 同步 architectures.py / bucket.py / cache_io.py / sai_model_spec.py 上游重构 (保留 Boogu 自研支持)
- 新增 Krea 2 根级 krea2_generate_image.py 包装器, 新增 ideogram4/krea2/block_swap 文档
v1.9.3 2026-06-27
Krea 2 / Boogu-Image 训练支持完善
- 修复 Krea 2 训练 FileNotFoundError: 缺少根目录包装脚本 (krea2_cache_latents/train_network 等)
- 从 musubi-tuner 上游同步 krea2/ 核心模块 (krea2_utils/sampling/mmdit/encoder), 解决 ImportError
- 修复 bucket.py Invalid architecture kr2: 新增 KREA2/BOOGU 架构分辨率步长映射
- 修复 sai_model_spec.py Unknown architecture: 新增 KREA2/BOOGU/IDEOGRAM4 架构注册
- 修复 architectures.py 缺少 KREA2 常量: 从上游同步 ARCHITECTURE_KREA2/kr2
- cache_io.py 新增 save_latent_cache_krea2 / save_text_encoder_output_cache_krea2 / boogu 缓存函数
v1.9.2 2026-06-27
便携环境路径修复
- 修复 fixVenvCfg() 已定义但从未调用的问题: pyvenv.cfg 里的绝对路径在别人电脑上不存在, 导致训练 DataLoader 多进程 spawn 时 FileNotFoundError [WinError 3]
- app.whenReady() 启动时自动调用 fixVenvCfg(), 每次启动修正 pyvenv.cfg 的 home/executable/command 为当前机器的实际路径
v1.9.1 2026-06-26
Z-Image 训练修复
- 修复 Z-Image TE 缓存 unrecognized arguments: --mixed_precision: zimage_cache_text_encoder_outputs.py 不支持该参数
- 修复 --mixed_precision 误传问题: 全面排查所有引擎 TE 缓存脚本, 确认仅 LTX2 的 ltx2_cache_text_encoder_outputs.py 支持, 其他模型 (Z-Image/Flux/Wan/Hunyuan/Qwen-Image 等) 一律不传
v1.9.0 2026-06-26
新增模型训练支持
- Krea 2 (musubi-tuner): 基于 krea2_train_network.py 训练, LoRA 模块 musubi_tuner.networks.lora_krea2; 组件含 DiT(raw.safetensors 26.3GB) + Qwen-Image VAE + Qwen3-VL-4B 文本编码器; fp8 训练需 --fp8_base + --fp8_scaled 成对使用; 工作流为在 Raw 上训练 LoRA → 在 Turbo 上推理
- Boogu-Image (musubi-tuner): 自研架构集成, 10B 混合双流 DiT (2 double-stream + 24 single-stream + 6 refiner); 组件含 DiT + FLUX.1 VAE (16通道latents) + Qwen3-VL 8B 文本编码器; LoRA 模块 musubi_tuner.networks.lora_boogu (target=None 覆盖所有 Linear 层); fp8 支持 --fp8_base --fp8_scaled + --fp8_llm (TE 量化); 自研 5 个集成文件 (boogu_utils/train_network/cache_latents/cache_text_encoder_outputs/lora_boogu)
LTX2.3 训练全流程修复
- 修复 Gemma rotary_emb buffer 验证误报: persistent=False 的 inv_freq 运行时重建, 修正后缀匹配逻辑 (.inv_freq → inv_freq) 以兼容 _inv_freq 变体
- 修复 TE 缓存 dtype 不匹配: BFloat16 vs Float, 新增 --mixed_precision bf16 (仅 TE 缓存, latent 缓存不支持)
- 修复 latent 缓存 unrecognized arguments: --mixed_precision 只传给 TE 缓存, 不传给 latent 缓存
- 移除 LTX2 训练无效参数 --i2v: LTX2 的 I2V 由 checkpoint 和 mode 决定, 不需要显式传参
- 修复 --fp8_base 重复传参: LTX2 专用段和通用段各加了一次, 通用段排除 LTX2
- 补充 LTX2 缓存/训练参数: --ltx2_checkpoint, --vae_dtype bf16, --ltx2_mode, --ltx2_audio_source, --separate_audio_buckets, --ltx_version_check_mode error 等
- 修复 network_module 覆盖: LTX2 不覆盖 (引擎默认 lora_ltx2), 不再误用通用 lora
训练页手动选模型功能
- 多组件模型每个组件新增"浏览"按钮, 可手动选择文件路径
- 自动根据组件类型分配到 modelPath/vaePath/textEncoderPath/clipPath
- 手动选择后自动设置组件状态为 ready, 解决模型文件名不匹配时的就绪问题
Flux 系列模型参数全面修复
- Flux.1 (sd-scripts): --vae → --ae, --text_encoder → --t5xxl, 新增 --clip_l 和 --model_prediction_type raw
- Flux.1 Kontext: --text_encoder → --text_encoder1 + --text_encoder2 (双编码器)
- Flux.2 (musubi-tuner): 新增 --model_version, --timestep_sampling flux2_shift, --weighting_scheme none
- network_module 修正: Flux.1 → networks.lora_flux, Flux.2 → networks.lora_flux_2 (原误用通用 lora)
- 参考 LoRAM 项目对比修复, 一次性解决全部参数差异
v1.8.2 2026-06-25
Python 环境修复
- 修复 pyvenv.cfg 路径修正正则 Bug: "home = xxx" 格式有空格导致替换失败,改为 \s* 匹配
- env/ 改为分离打包: 用户安装软件后手动解压 env.zip 到 resources/ 目录
- autoDetectPython() 只检测项目内 Python 环境,绝不回退到系统 Python
- fixVenvCfg() 每次启动自动修正 pyvenv.cfg 的 home/executable/command 路径
授权系统
- 新增"月付版": 支持自定义 1-36 个月授权时长,天数按 Math.round(months × 30.4375) 计算
- 版本编号重新编排: 1=体验版 2=月付版 3=年费版 4=终身版
v1.8.0 2026-06-25
训练监控改进
- 修复 s/step 和剩余时间不显示的问题: tqdm 进度条用 \r 刷新无 \n, 改用 TextIOWrapper universal newline 模式实时读取, 即时解析 step/total_steps/loss
- Monitor 页面: s/step 带 60/40 加权平滑 (当前步偏向60% 历史平均40%), ETA 实时更新
- 新增"🧹 清理显存"按钮: 训练停止后手动清理残留 GPU 进程, 底层用 nvidia-smi 查询并 taskkill 清除
训练稳定性
- 训练停止/退出时自动杀整棵子进程树, 彻底释放 GPU 显存 (SIGTERM + taskkill /T /F)
- train.py 注册 atexit 回调确保异常退出也不残留 GPU 进程
- FP8 兼容性修复: 按模型类型精确判断 --fp8_llm / --fp8_t5 / --fp8_base, 避免传给不支持的模型导致崩溃
- HuggingFace tokenizer 本地化: Z-Image/Qwen-Image 优先从本地缓存加载 tokenizer, 找不到才走网络, 解决国内网络超时问题
- 支持配置 HuggingFace 镜像 (如 hf-mirror.com), 通过 HF_ENDPOINT 环境变量传递给训练子进程
用户体验
- 新增"保持参数"功能: 切换模型时锁定训练参数和数据集组 (localStorage 持久化), 按钮在"重置参数"旁
- 进入训练页面自动检测模型组件, 无需手动点"重新检测"
- 授权新增"体验版"等级 (49元/30天)
v1.7.0 2026-06-24
软件授权系统
- 新增激活码验证机制, 基于数字签名防伪造
- 硬件绑定: 一机一码, 激活码仅限当前设备使用
- 多点校验: 启动和关键操作时自动验证授权状态
- 未激活状态下禁止训练功能, 保障付费用户权益
激活页面
- 新增激活界面: 机器码显示+复制, 激活码输入, 激活/解绑操作
- 未激活时自动跳转激活页, 全屏界面不显示侧边栏
- 设置页新增"软件授权"区, 显示激活状态/机器码/VIP等级/到期时间
代码保护
- 新增代码混淆保护 (构建时自动执行)
- 主进程和预加载脚本自动混淆, 防止逆向分析
管理员工具
- 激活码生成工具 (交互+CLI 模式)
- 支持多种时长授权, 自动保存记录
v1.6.0 2026-06-23
新增 Ideogram 4 训练支持
- 研究确认 Ideogram 4 已开源 (9.3B 参数, 2026年6月发布), musubi-tuner 官方支持
- train.py: MUSUBI_MAP 新增 ideogram4 映射 (ideogram4_train_network.py + 2个缓存脚本)
- train.py: network_module 选择增加 ideogram4 → musubi_tuner.networks.lora_ideogram4 (专用LoRA模块)
- config_gen.py: MUSUBI_TYPES 新增 ideogram4, 使用 musubi-tuner 格式生成数据集 TOML
- models.ts: 新增 Ideogram 4 模型, 3个组件 (DiT FP8 + Qwen3-VL 8B + Flux2 VAE), 全部来自 Comfy-Org/Ideogram-4
- DiT 仅 FP8 格式 (无 BF16 权重), 不需要 --fp8_base 标志, 最大 blocks_to_swap=33
- 非商用许可, 文本编码器为 Qwen3-VL 8B (53,248通道条件序列), VAE 为 Flux2 KL-VAE
热门模型标记
- 调研 Civitai LoRA 生态活跃度, 确定各模型热度梯队
- models.ts: ModelInfo 接口新增 hot?: boolean 字段
- 标记 10 个热门模型: Flux.1/SDXL/Flux.2 Dev (第一梯队) + Anima/Z-Image×2/Wan×2/LTX 2.3/Ideogram 4 (第二梯队)
- Training.vue: 模型选择器热门模型排到分类最前面, 名称前加🔥标记
- 分类标签后显示热门数量, 如 "Flux 系列 (2热门)"
v1.5.0 2026-06-23
全模型多组件检测完善
- 查阅 musubi-tuner / sd-scripts / ltx2 / acestep 全部引擎文档, 确定每个模型所需文件
- 给 35 个模型补上 components 定义: Flux.2 系列(3个) + Z-Image(3个) + Lumina + HunyuanImage 2.1 + LTX 系列(5个) + ACE-Step(4个) + HiDream + Kandinsky5
- 组件支持跨仓库下载 (repo 字段): 如 Flux T5/CLIP 来自 comfyanonymous/flux_text_encoders
- 文本编码器关键词扩展: 增加 umt5/llava/llama/gemma 匹配
版本管理系统
- package.json 版本号 1.0.0 → 1.5.0
- 侧边栏「专业版」版本号同步更新
- 设置页新增「📋 版本更新日志」面板, 时间线样式展示完整迭代历史
- 关于区版本号同步更新
v1.4.0 2026-06-23
模型检测假阳性修复 (关键 bug)
- 根因: main.ts model-resolve-path 文件型模型检测用"目录里有任意 .safetensors 就算有", 导致只下了 DiT 但 Qwen3/VAE 也显示 ✅ 已就绪
- 修复: 改为精确文件名匹配 + 文件大小校验 (>1MB 单文件, >10MB 目录型)
- 5 层检测逻辑全部加文件大小校验: externalPath / deepFindFile / isDir外部 / isDir项目 / 文件型
- 新增「🔄 重新检测」按钮 (单组件 + 多组件面板), 删文件后可刷新状态
- downloadAllComponents 智能跳过: 下载前先查文件系统, 已有文件不重复下载
- 下载完成后自动 recheckComponents 刷新状态
多组件模型校验增强
- canStart computed: 多组件模型所有 required 组件必须 ready 才能开始训练
- handleStart: 二次校验, 缺文件弹出具体缺少哪些的提示
- models.ts: Anima LLLite 补上 3 个 components 定义 (之前没有, 只走单文件检测)
v1.3.0 2026-06-23
Anima 训练修复
- network_module bug: train.py 对 sd-scripts 引擎一律用 networks.lora, 但 Anima 需要 networks.lora_anima → 训练报错
- 修复: build_train_args() 增加 anima/anima_lllite 判断, 使用正确的 lora_anima 模块
- 确认 Anima 训练需 3 个文件: DiT + Qwen3文本编码器 + Qwen-Image VAE (用户最初只下了 DiT)
- 下载来源确认: huggingface.co/circlestone-labs/Anima → split_files/ 下三个子目录
v1.2.0 2026-06-23
移除训练时采样功能
- 用户认为训练时采样(自动跑图)多余, 要求移除
- Training.vue: 删除采样 UI 整块 (开关 + 提示词 + 4个参数) + samplingEnabled computed + .sampling-config CSS
- training.ts: 删除 TrainingConfig 接口 6 个采样字段 + 默认值 + 两处 job JSON 构建 + loadJob 还原
- train.py: 本来就没用到采样参数 (build_train_args 没有 --sample_* 输出), 无需改动
v1.1.0 2026-06-23
数据集批量工具 (新功能)
- 图片裁剪/缩放: 3 种模式 (crop 中心裁剪 / pad 填充 / stretch 拉伸), 用 PIL 实现
- 批量重命名: 支持 {index} 占位符 + txt 同步重命名, 两阶段临时文件避免冲突
- 批量打标优化: 从前端逐张 IPC 改为单次 IPC 主进程批量处理, 大幅提速
- 新建 image_tools.py Python 脚本处理图片
- main.ts 新增 3 个 IPC handler + Dataset.vue 新增「🛠 批量工具」对话框
DeepSeek AI 诊断 (新功能)
- main.ts 新增 deepseek-chat IPC handler, 用 Node.js https 模块调用 DeepSeek API
- Monitor.vue 日志区新增 AI 诊断栏: 一键诊断报错 + 自由提问
- AI 回复直接显示在日志面板内, 带特殊样式 (用户=紫框, AI=绿框)
- Settings.vue 新增 API Key / 模型选择配置区
- 轻量 markdown→HTML 转换 (代码块/粗体/标题/列表)
编码崩溃修复 (关键 bug)
- 根因: PYTHONUTF8=1 被 train.py 传给引擎子进程, git 的 GBK 输出被当 UTF-8 解码 → UnicodeDecodeError: 0xb2 反复崩溃
- 关键: PYTHONUTF8 影响子进程管道解码, PYTHONIOENCODING 只影响 stdout 编码 — 两者不同
- 修复: build_env() 移除 PYTHONUTF8, 只保留 PYTHONIOENCODING=utf-8
- 日志过滤: training store 新增 NOISE_PATTERNS 过滤器, 屏蔽 _readerthread / triton / git hash 等噪音
- triton 安装: pip install triton-windows 到项目 venv (D:\LoRA-Angel\env), 消除 flop_counter 警告
训练日志不更新修复
- 根因: training-event IPC 监听器只在 Training.vue 注册, 跳转监控页后 Training.vue 卸载 → 监听器被移除 → Monitor 收不到事件
- 修复: Monitor.vue 也注册 training-event 监听器, 跳转后无缝接管
sd-scripts TOML caption 崩溃修复
- 根因: config_gen.py 给 sd-scripts TOML 写了 caption 字段, 但 voluptuous schema 不允许 → MultipleInvalid
- 修复: 删除 sd-scripts TOML 中的 caption 字段
Training.vue CSS 构建错误修复
- 孤立 CSS 块 (无选择器属性) 导致 CSS 解析错误
- 两个冲突的 :deep() 块互相覆盖
- 缺失 .repeat-table / .repeat-hint / .row-active 样式
- 合并 :deep() 块为单一透明背景规则, 删除孤立 CSS
Monitor.vue 大重构
- 布局重设计: 顶部工具栏左侧按钮, 右侧内联"炼丹状态"和"炼丹进度"(圆点脉冲动画)
- 系统状态紧凑化: 大卡片式 → 单行紧凑条 (ai-toolkit 风格), GPU 温度带颜色预警
- 训练日志最大化: flex:1 占满剩余高度, 从 380px 固定改为自适应
- 进度条简化: 独立 section → 顶部栏下方单行紧凑
历史炼丹记录
- train.py 保存完整 job JSON 到 job_config.json
- Monitor.vue 底部新增历史记录列表, 点击"复用配置"加载参数并跳转训练页
UI 交互优化
- 训练启动后自动跳转监控页
- 停止按钮从训练页迁移到监控页
- 数据集 UI 简化: 高级选项折叠收起, "Dataset 1" → "最终出图效果组"
- 数据集打开文件夹功能: 新增「📁 打开」按钮
- train.py bufsize=1 → bufsize=0 修复 binary 模式行缓冲警告
v1.0.0 2026-06-22
初始发布版本
- Electron + Vue 3 + Element Plus 桌面应用框架搭建, Pinia 状态管理, Vue Router hash 模式
- 训练配置页: 模型选择 (cascader 多级) + 数据集组管理 + LoRA 参数 + 显存优化 (fp8/块交换)
- Python 桥接: train.py + config_gen.py, 生成 TOML 配置并调用引擎脚本
- 训练监控页: 实时日志 + 进度条 + 系统状态 (GPU/内存/磁盘/温度)
- 数据集管理页: 创建/删除数据集 + 图片预览画廊
- 设置页: 环境自检 + Python/引擎路径配置 + 模型搜索路径 + HuggingFace 镜像
- 模型自动下载: HuggingFace hf_hub_download + 镜像支持
引擎支持
- musubi-tuner: Flux / Qwen Image / Wan / 混元 / Z-Image / LTX / HiDream / Kandinsky
- sd-scripts: Flux.1 / SD / SDXL / SD3 / Anima / HunyuanImage / Lumina
- musubi-tuner-ltx2: LTX 2.0 / 2.3
- musubi-tuner-acestep: ACE-Step 音乐生成
核心功能
- 42 种模型架构支持, 覆盖文生图/图生视频/视频编辑/音乐生成
- 编辑模型配对训练: Kontext / Qwen Edit 等支持控制图配对数据集
- 多组权重控制: 不同模块设置不同 dim/alpha/学习率 (module_groups)
- VLM 自动打标: 支持 JoyTagger / WD14 Tagger 等打标模型
- 模型搜索路径: 用户自定义目录 + 深度搜索子目录
- 多组件模型检测: Anima (DiT+Qwen3+VAE) 等多文件模型逐个检测
- 训练参数: 学习率/批次/epoch/精度/优化器/调度器/保存间隔等完整配置
- 缓存机制: cache_latents + cache_text_encoder_outputs 省显存
UI 设计
- 深色/粉色双主题切换
- 侧边栏: 天使LoRA Pro 标识 + 专业版 v1.0.0 + 作者信息
- ai-toolkit 风格的数据集组配置
- 训练参数智能推荐: Num Repeats 根据图片数自动推荐
- 块交换智能推荐: 根据模型大小和显存推荐 blocks_to_swap 值
v0.9.0 2026-06-22
Beta 测试版 (发布前最后迭代)
- 多版 UI 调整: 训练页布局反复优化, 数据集卡片样式/折叠行为多次修改
- CSS 冲突修复: :deep() 透明背景反复调参, el-collapse 样式适配
- 侧边栏版本号反复调整: 专业版标识 + 版本号显示位置
- 模型注册表反复完善: 新增/调整模型类型, externalPaths 路径修正
- config_gen.py TOML 生成逻辑多次修正: sd-scripts vs musubi-tuner 字段差异
- train.py build_train_args 反复调整: 不同引擎/模型类型的参数组合
- 模型下载脚本调试: hf_hub_download 路径/镜像/分片文件处理
- 环境自检模块调试: Python/PyTorch/CUDA 探测逻辑
- 预加载脚本 preload.ts 反复调整: IPC 接口暴露/参数格式
- 路由调试: hash 模式跳转/训练启动后跳转监控页
v0.5.0 2026-06-21
Alpha 内测版
- 项目初始化: Electron + Vue 3 + Vite + TypeScript 脚手架搭建
- 基础布局: 侧边栏导航 + 主内容区, 训练/监控/数据集/设置四页面骨架
- Pinia store 初版: training store 状态管理 (config/datasetGroups/isTraining/logs)
- Python 桥接初版: train.py 基本框架, subprocess 调用引擎脚本
- config_gen.py 初版: TOML 配置生成 (musubi-tuner 格式)
- 模型注册表初版: models.ts 定义首批模型 (Flux/Qwen/Wan/混元)
- IPC 通信框架: main.ts + preload.ts 基础接口
- 首次成功训练: musubi-tuner + Flux.1 Dev LoRA 训练跑通
v0.1.0 2026-06-20
项目启动
- 项目构思: 一站式 LoRA 训练桌面应用, 降低 LoRA 训练门槛
- 技术选型: Electron (跨平台桌面) + Vue 3 (响应式 UI) + Python (训练引擎桥接)
- 引擎选型: musubi-tuner + sd-scripts (社区最活跃的两个 LoRA 训练框架)
- UI 框架选型: Element Plus (组件丰富, 中文友好)
- 项目结构设计: src/ (前端) + electron/ (主进程) + python_bridge/ (Python桥接) + engines/ (训练引擎)
← 返回首页