Skip to content

视觉与图像修复模型

设置 -> 流水线中为每个处理阶段选择一个模型。预处理和选项由对应模型拥有,切换模型不会创建第二套工作流。

检测

当前检测处理器是 Koharu Layout RF-DETR Seg 2XL。它寻找文字、气泡和分格,并生成后续阶段使用的分割数据。

文字、气泡、分格阈值越低,保留的不确定区域越多,误检也可能增加。只应在检查多张代表页面后调整。

OCR

  • PaddleOCR-VL 1.6 — 默认通用视觉语言 OCR
  • Manga OCR — 面向日文漫画文字
  • Baberu OCR — 另一种漫画识别器

OCR 只对检测文字区域运行。检测遗漏的文字无法由 OCR 恢复,所以空结果不一定是识别模型本身的问题。

图像修复

  • LaMa — 默认直接修复模型
  • AOT Inpainting — 另一种直接模型
  • FLUX.2 Klein — 带提示词的生成式修复
  • RORem Mixed — 带正负提示词的漫画生成式修复

生成式模型通常需要更大的运行时、更多内存和更长时间。提示词应专注于重建周围画面并排除文字,不要要求修复模型排入译文。

模型配置档

支持的处理器会独立保留自己的设置。切回生成式模型时,会恢复该模型的提示词配置,而不会套用其他模型的字段。

模型按需加载。首次运行包含下载、加载和性能画像成本。比较质量时,请在预热后对相同页面测试。