视觉与图像修复模型¶
在设置 -> 流水线中为每个处理阶段选择一个模型。预处理和选项由对应模型拥有,切换模型不会创建第二套工作流。
检测¶
当前检测处理器是 Koharu Layout RF-DETR Seg 2XL。它寻找文字、气泡和分格,并生成后续阶段使用的分割数据。
文字、气泡、分格阈值越低,保留的不确定区域越多,误检也可能增加。只应在检查多张代表页面后调整。
OCR¶
- PaddleOCR-VL 1.6 — 默认通用视觉语言 OCR
- Manga OCR — 面向日文漫画文字
- Baberu OCR — 另一种漫画识别器
OCR 只对检测文字区域运行。检测遗漏的文字无法由 OCR 恢复,所以空结果不一定是识别模型本身的问题。
图像修复¶
- LaMa — 默认直接修复模型
- AOT Inpainting — 另一种直接模型
- FLUX.2 Klein — 带提示词的生成式修复
- RORem Mixed — 带正负提示词的漫画生成式修复
生成式模型通常需要更大的运行时、更多内存和更长时间。提示词应专注于重建周围画面并排除文字,不要要求修复模型排入译文。
模型配置档¶
支持的处理器会独立保留自己的设置。切回生成式模型时,会恢复该模型的提示词配置,而不会套用其他模型的字段。
模型按需加载。首次运行包含下载、加载和性能画像成本。比较质量时,请在预热后对相同页面测试。