manga ocr base

提供商kha-white
分类image-to-text
许可证apache-2.0
下载量520.4K
星标0

简介

manga ocr base 是一款专为漫画场景优化的图像文字识别模型。不同于通用 OCR 难以处理漫画中垂直排版、艺术字体或复杂背景的问题,该模型针对日漫等特定排版进行了深度优化,能更精准地提取对话框中的文本。对于想要搭建自动化翻译工作流、制作漫画数据库或进行本地化翻译的开发者来说,它是一个极佳的底层组件。上手难度较低,可直接集成到图像处理 pipeline 中,配合翻译 API 即可实现从图片到文本的快速转化。

核心亮点

  • 深度优化漫画垂直排版与特殊字体识别
  • 高效提取对话框文本,降低后处理压力
  • Apache-2.0 协议,支持商业化自由部署
  • 理想的漫画自动翻译工作流前端组件

使用方法

安装依赖
# 安装 Hugging Face transformers
pip install transformers torch
SDK 使用
# 使用 transformers 加载模型
from transformers import AutoModel, AutoTokenizer

model = AutoModel.from_pretrained("kha-white/manga-ocr-base")
tokenizer = AutoTokenizer.from_pretrained("kha-white/manga-ocr-base")

Hugging Face 下载

我们推荐使用命令行或者 Hugging Face Hub SDK 来进行模型的下载。

操作指引:在下载前,请先通过如下命令安装 huggingface_hub:

操作指引
pip install -U huggingface_hub

命令行下载

下载完整模型库

下载完整模型库
huggingface-cli download kha-white/manga-ocr-base

下载单个文件到指定本地文件夹(以下载 config.json 到当前路径下 ./dir 目录为例)

下载单个文件到指定本地文件夹(以下载 config.json 到当前路径下 ./dir 目录为例)
huggingface-cli download kha-white/manga-ocr-base config.json --local-dir ./dir

更多命令行下载选项,可参见官方文档

SDK 下载

SDK 下载
# 模型下载
from huggingface_hub import snapshot_download
model_dir = snapshot_download('kha-white/manga-ocr-base')

Git 下载

请确保 lfs 已经被正确安装

Git 下载
git lfs install
git clone https://huggingface.co/kha-white/manga-ocr-base

如果您希望跳过 lfs 大文件下载,可以使用如下命令

跳过 LFS
GIT_LFS_SKIP_SMUDGE=1 git clone https://huggingface.co/kha-white/manga-ocr-base

模型文件托管在 Hugging Face Hub,使用 HF CLI / SDK / Git 直接下载,不经过本站。

PyTorch / Transformers 使用

安装 Transformers

安装 Transformers
pip install -U transformers torch

模型加载和推理

模型加载和推理
from transformers import AutoModelForCausalLM, AutoTokenizer

model = AutoModelForCausalLM.from_pretrained('kha-white/manga-ocr-base')
tokenizer = AutoTokenizer.from_pretrained('kha-white/manga-ocr-base')

完整文档

来源: HuggingFace

---
language: ja
tags:

  • image-to-text

license: apache-2.0
datasets:
  • manga109s

---

Manga OCR

Optical character recognition for Japanese text, with the main focus being Japanese manga.

It uses Vision Encoder Decoder framework.

Manga OCR can be used as a general purpose printed Japanese OCR, but its main goal was to provide a high quality
text recognition, robust against various scenarios specific to manga:

  • both vertical and horizontal text

  • text with furigana

  • text overlaid on images

  • wide variety of fonts and font styles

  • low quality images

Code is available here.