马上注册,结交更多好友,享用更多功能,让你轻松玩转社区。
您需要 登录 才可以下载或查看,没有帐号?免费注册
x
本帖最后由 明心亘青 于 2026-5-27 00:06 编辑
这篇教程面向的群体,稍微直言不讳一点,是略微“欠缺了实操能力”的人。因为本文并不会引入新概念,而是会结合本人过去几篇文章(《一种在 ComfyUI 中基于 ControlNet 的基础构图方式》《新模型 Anima 的使用体会》等)中所提及的内容,搭建一个借助Anima 的自然语言生图能力,兼容 SDXL 的画师串、Lora的工作流。而如果你能够理解我过去这些文章的内容,那么本文所阐释的内容对你而言是毫无压力的。 你当我没活硬整也行( 你或许听过让你丢掉 SDXL,拥抱Anima 的言论。但我们知道,Anima 对于画师串的兼容堪称灾难级别,这大概率是缘于其仅有2B 的参数以及目前没有训练完成。可是,二次元生图最重要的因素当然就是画师串,模型默认画风虽然大多都不难看,但千篇一律、大众化,迟早会看腻的,只有画师串能为我们的图像带来多样性。与此同时,由于Anima 太过年轻,社区尚未成功发展,不管是基于模型本身的微调模型还是 Lora 相较于 SDXL 都太少。但不幸的是,不管是目前主流的光辉还是 Noob,其语义理解都太过落后了。仅仅支持 Tag 式的文本输入便已经造成了极大的不便。一个典型的例子便是萝莉色图当中的“日不落”或者说“雌悬浮”,在不借助Lora 的前提下,从我个人的经历来说,我必须抽奖才能从一些原本并不专门描述这个动作的 Prompt 中抽出来(模型实在太喜欢让女孩子的脚沾地了……),麻烦得很。Anima 作为DIT 架构的新模型,在接入了 Qwen3 后也为 Anima本身带来了理解自然语言的能力。那么有没有一种可能,让我们既可以使用 Anima 的语义理解,又能够使用 SDXL 的画师串呢?有的兄弟有的,那就是 ControlNet。 结合 ControlNet,我们可以在一个工作流里同时使用 Anima 的生图与 SDXL 的洗图。 本文依旧使用 Depth 作为示例。 让我们先摆好两个常规的工作流: (随手搓的画师串。不难看出 SDXL 的生图质量真的吊打 Anima,但是画面丰富度上 Anima 又赢麻了…………) 接下来,找到 ControlNet 相关节点: 将之插入到 SDXL 的文生图流程中,我们有: 搜索 Depth Anything: DepthAnythingV2预处理器分辨率设置建议为图像短边分辨率长度,可以自行寻找节点统一。 连接,有: (将 Anima 生成的图像连接到预处理器,再将预处理器处理完的图像输入到ControlNet 应用当中。) 先运行,看看效果: 运行正常。 其实到这一步为止,我们的工作流主体就已经搭建完成了。但是我们这个是深度 ControlNet,只到这一步还是不够。 当然你用 Lineart 的话那确实完结了: 搜索节点:WD14 Tagger 然后搜索这四个节点: (没有系统提示词的也没问题) 当然这个不强求,但你最好有一个 LLM 可以调用。否则你将无法从 SDXL 上入手去决定生图人物样貌。 结合前面的 WD14,连接一下,得到这个: 当然,聪明的你一定能发现,这里其实只是在 Cosplay Qwen3的图像反推提示词罢了。原则上没有后面的 LLM 也能用,但是WD14 识图并不能读心,这导致不管是发色还是什么,它反推出的 Prompt 总是会保留原图像的各种外貌信息,如果我们想借这个姿势跑一些别的模型本身不认识的人物,那么就会收到这些外貌 Tag 的污染。你当然也能在排除标签一栏当中进行排除,但量太大了,倒不如接个 LLM。你可以用LLM 删掉那些不需要的 Prompt。 当然这并不意味着 LLM 就不需要抽奖了,有的时候LLM 也会删掉一些有用的 Prompt,但比自己手删省心多了不是。 系统提示词随便写一下就好。 然后我们需要微调一下 SDXL 部分的流程,搜索节点字符串(多行)和 String Function: 然后按照下图所示进行连接: 略微整理一下后,工作流大概会长这样: 由于人物区分度大概不会很明显,我这里加入一段人物提示词,也就是典中典的 hatsune_miku, vocaloid, 也就是告诉模型要跑来自 Vocaloid的初音未来。 如果将 LLM 屏蔽掉,那么这一次的出图就是: 很明显地看到一致性有很大区别。这个涉及到的其实是 ControlNetDepth 的原理,我过去的文章讲过。 现在让我们实践一下 NSFW 的内容: 必须指出的是现在 Anima 问题不小,从我体验上出发最显著的一个就是提示词太长时会崩图,所以 Flux、Qwen·Image 以及 Z-image 都要当作是Anima 的代替品之一。 目前而言,Anima 的局限性还是很大,也因此我仍旧主张使用其他的模型甚至是直接去 Pixiv 搜 Tag让自己跑自己想看的图。当然这自然与 Anima 未训练完成有关,我倒很期待看到那一天。在此之前还是接着使用SDXL 吧。 玩得开心。
更新:Anima Base 问世后我也稍微研究了一下相关的情况,总之大概就是 XL 的画师串是因为 CLIP 本身的语义理解较为贫弱,每个 Tag 都是作为独立的元素影响噪声的生成,结果在输入多个画师 Tag 时就产生了风格的「融合」,某种程度上来说画师串算 CLIP 语义理解的副产物。
而 Anima 使用的是 Qwen 3 0.6B 作为语义理解,LLM 在运作时的原理与 CLIP 不尽相同,每个输入的文本在 LLM 影响噪声生成时都是「连续」而非「独立」的,此时单纯陈列画师 Tag 会导致 LLM 无法正确理解这段输入,从而导致画风「融合」能力变弱。这是 Anima 在训练之初就会存在的难以解决的问题。不过在实践中,输入两到三个画师 Tag 还是有些作用的,再多就有些微乎其微了。感兴趣的可以自己研究研究。
|