punctuate all

提供商kredor
分类token-classification
许可证mit
下载量631.4K
星标0

简介

punctuate all 是一个专注于文本标点恢复的 Token 分类模型。它主要解决的是在语音转文字(ASR)或某些低质量文本抓取中常见的“缺失标点”痛点,能通过上下文语义自动补全句号、逗号等符号。对于开发者而言,它不是一个通用聊天模型,而是一个高效的预处理工具,适合集成在自动化文本清洗管线中,将杂乱的文本流转化为可读性强的标准段落,上手门槛极低,可直接替代复杂的正则匹配或昂贵的通用大模型标点修复任务。

核心亮点

  • 精准修复 ASR 语音转文字缺失的标点
  • 轻量级 Token 分类架构,推理速度极快
  • MIT 协议开源,方便企业私有化部署
  • 提升下游 NLP 任务的文本解析准确率

使用方法

安装依赖
# 安装 Hugging Face transformers
pip install transformers torch
SDK 使用
# 使用 transformers 加载模型
from transformers import AutoModel, AutoTokenizer

model = AutoModel.from_pretrained("kredor/punctuate-all")
tokenizer = AutoTokenizer.from_pretrained("kredor/punctuate-all")

Hugging Face 下载

我们推荐使用命令行或者 Hugging Face Hub SDK 来进行模型的下载。

操作指引:在下载前,请先通过如下命令安装 huggingface_hub:

操作指引
pip install -U huggingface_hub

命令行下载

下载完整模型库

下载完整模型库
huggingface-cli download kredor/punctuate-all

下载单个文件到指定本地文件夹(以下载 config.json 到当前路径下 ./dir 目录为例)

下载单个文件到指定本地文件夹(以下载 config.json 到当前路径下 ./dir 目录为例)
huggingface-cli download kredor/punctuate-all config.json --local-dir ./dir

更多命令行下载选项,可参见官方文档

SDK 下载

SDK 下载
# 模型下载
from huggingface_hub import snapshot_download
model_dir = snapshot_download('kredor/punctuate-all')

Git 下载

请确保 lfs 已经被正确安装

Git 下载
git lfs install
git clone https://huggingface.co/kredor/punctuate-all

如果您希望跳过 lfs 大文件下载,可以使用如下命令

跳过 LFS
GIT_LFS_SKIP_SMUDGE=1 git clone https://huggingface.co/kredor/punctuate-all

模型文件托管在 Hugging Face Hub,使用 HF CLI / SDK / Git 直接下载,不经过本站。

PyTorch / Transformers 使用

安装 Transformers

安装 Transformers
pip install -U transformers torch

模型加载和推理

模型加载和推理
from transformers import AutoModelForCausalLM, AutoTokenizer

model = AutoModelForCausalLM.from_pretrained('kredor/punctuate-all')
tokenizer = AutoTokenizer.from_pretrained('kredor/punctuate-all')

完整文档

来源: HuggingFace

---
license: mit
datasets:

  • wmt/europarl

metrics:
  • f1

  • recall

  • precision

---
This is based on Oliver Guhr's work. The difference is that it is a finetuned xlm-roberta-base instead of an xlm-roberta-large and on twelve languages instead of four. The languages are: English, German, French, Spanish, Bulgarian, Italian, Polish, Dutch, Czech, Portugese, Slovak, Slovenian.

----- report -----

precision recall f1-score support

0 0.99 0.99 0.99 73317475
. 0.94 0.95 0.95 4484845
, 0.86 0.86 0.86 6100650
? 0.88 0.85 0.86 136479
- 0.60 0.29 0.39 233630
: 0.71 0.49 0.58 152424

accuracy 0.98 84425503
macro avg 0.83 0.74 0.77 84425503
weighted avg 0.98 0.98 0.98 84425503

----- confusion matrix -----

t/p 0 . , ? - :
0 1.0 0.0 0.0 0.0 0.0 0.0
. 0.0 1.0 0.0 0.0 0.0 0.0
, 0.1 0.0 0.9 0.0 0.0 0.0
? 0.0 0.1 0.0 0.8 0.0 0.0
- 0.1 0.1 0.5 0.0 0.3 0.0
: 0.0 0.3 0.1 0.0 0.0 0.5