t5 base indonesian summarization cased

提供商cahya
分类summarization
许可证Apache-2.0
下载量10.9K
星标0

简介

这是一个基于 T5-base 架构并针对印尼语(Indonesian)微调的文本摘要模型。它采用了 Cased(区分大小写)处理,能够更精准地识别印尼语中的专有名词。对于需要处理印尼语语料的开发者来说,该模型提供了一种轻量级的端到端摘要方案,无需从头训练即可实现长文本压缩。其上手难度较低,可通过 Hugging Face 等主流框架快速部署,适合集成到跨国电商评论分析、印尼本地新闻聚合或多语言办公自动化等实际业务场景中。

核心亮点

  • 专为印尼语优化,文本摘要效果更地道
  • 基于 T5 架构,支持主流深度学习框架
  • 区分大小写处理,专有名词识别更精准
  • Apache-2.0 协议,商业化部署无压力

使用方法

安装依赖
# 安装 Hugging Face transformers
pip install transformers torch
SDK 使用
# 使用 transformers 加载模型
from transformers import AutoModel, AutoTokenizer

model = AutoModel.from_pretrained("cahya/t5-base-indonesian-summarization-cased")
tokenizer = AutoTokenizer.from_pretrained("cahya/t5-base-indonesian-summarization-cased")

Hugging Face 下载

我们推荐使用命令行或者 Hugging Face Hub SDK 来进行模型的下载。

操作指引:在下载前,请先通过如下命令安装 huggingface_hub:

操作指引
pip install -U huggingface_hub

命令行下载

下载完整模型库

下载完整模型库
huggingface-cli download cahya/t5-base-indonesian-summarization-cased

下载单个文件到指定本地文件夹(以下载 config.json 到当前路径下 ./dir 目录为例)

下载单个文件到指定本地文件夹(以下载 config.json 到当前路径下 ./dir 目录为例)
huggingface-cli download cahya/t5-base-indonesian-summarization-cased config.json --local-dir ./dir

更多命令行下载选项,可参见官方文档

SDK 下载

SDK 下载
# 模型下载
from huggingface_hub import snapshot_download
model_dir = snapshot_download('cahya/t5-base-indonesian-summarization-cased')

Git 下载

请确保 lfs 已经被正确安装

Git 下载
git lfs install
git clone https://huggingface.co/cahya/t5-base-indonesian-summarization-cased

如果您希望跳过 lfs 大文件下载,可以使用如下命令

跳过 LFS
GIT_LFS_SKIP_SMUDGE=1 git clone https://huggingface.co/cahya/t5-base-indonesian-summarization-cased

模型文件托管在 Hugging Face Hub,使用 HF CLI / SDK / Git 直接下载,不经过本站。

PyTorch / Transformers 使用

安装 Transformers

安装 Transformers
pip install -U transformers torch

模型加载和推理

模型加载和推理
from transformers import AutoModelForCausalLM, AutoTokenizer

model = AutoModelForCausalLM.from_pretrained('cahya/t5-base-indonesian-summarization-cased')
tokenizer = AutoTokenizer.from_pretrained('cahya/t5-base-indonesian-summarization-cased')

完整文档

来源: HuggingFace

---
language: id
tags:

  • pipeline:summarization

  • summarization

  • t5

datasets:
  • id_liputan6

---

Indonesian T5 Summarization Base Model

Finetuned T5 base summarization model for Indonesian.

Finetuning Corpus

t5-base-indonesian-summarization-cased model is based on t5-base-bahasa-summarization-cased by huseinzol05, finetuned using id_liputan6 dataset.

Load Finetuned Model

python
from transformers import T5Tokenizer, T5Model, T5ForConditionalGeneration

tokenizer = T5Tokenizer.from_pretrained("cahya/t5-base-indonesian-summarization-cased")
model = T5ForConditionalGeneration.from_pretrained("cahya/t5-base-indonesian-summarization-cased")

Code Sample

python
from transformers import T5Tokenizer, T5ForConditionalGeneration

tokenizer = T5Tokenizer.from_pretrained("cahya/t5-base-indonesian-summarization-cased")
model = T5ForConditionalGeneration.from_pretrained("cahya/t5-base-indonesian-summarization-cased")

#
ARTICLE_TO_SUMMARIZE = ""

generate summary

input_ids = tokenizer.encode(ARTICLE_TO_SUMMARIZE, return_tensors='pt') summary_ids = model.generate(input_ids, min_length=20, max_length=80, num_beams=10, repetition_penalty=2.5, length_penalty=1.0, early_stopping=True, no_repeat_ngram_size=2, use_cache=True, do_sample = True, temperature = 0.8, top_k = 50, top_p = 0.95)

summary_text = tokenizer.decode(summary_ids[0], skip_special_tokens=True)
print(summary_text)

Output:

code