t5 base indonesian summarization cased
Overview
Highlights
- Optimized for high-accuracy Indonesian text summarization
- Efficient T5 base architecture ensures low inference latency
- Cased tokenization preserves proper nouns and context
- Apache-2.0 license allows flexible commercial integration
- Seamless deployment via standard Hugging Face transformers
Usage
# Install Hugging Face transformers
pip install transformers torch
# Load model with transformers
from transformers import AutoModel, AutoTokenizer
model = AutoModel.from_pretrained("cahya/t5-base-indonesian-summarization-cased")
tokenizer = AutoTokenizer.from_pretrained("cahya/t5-base-indonesian-summarization-cased")
Hugging Face Download
We recommend downloading the model via the Hugging Face CLI or Hub SDK.
Guidance:Before downloading, install huggingface_hub with:
pip install -U huggingface_hub
CLI Download
Download the full repository
huggingface-cli download cahya/t5-base-indonesian-summarization-cased
Download a single file to a local folder (e.g. config.json into ./dir)
huggingface-cli download cahya/t5-base-indonesian-summarization-cased config.json --local-dir ./dir
See the official docs for more CLI options
SDK Download
# 模型下载
from huggingface_hub import snapshot_download
model_dir = snapshot_download('cahya/t5-base-indonesian-summarization-cased')
Git Download
Make sure git-lfs is installed first
git lfs install
git clone https://huggingface.co/cahya/t5-base-indonesian-summarization-cased
To skip LFS large-file downloads, use:
GIT_LFS_SKIP_SMUDGE=1 git clone https://huggingface.co/cahya/t5-base-indonesian-summarization-cased
Model files are hosted on the Hugging Face Hub — download directly via HF CLI / SDK / Git, not through this site.
PyTorch / Transformers Usage
Install Transformers
pip install -U transformers torch
Load the model and run inference
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained('cahya/t5-base-indonesian-summarization-cased')
tokenizer = AutoTokenizer.from_pretrained('cahya/t5-base-indonesian-summarization-cased')
Full Documentation
---
language: id
tags:
- pipeline:summarization
- summarization
- t5
datasets:
- id_liputan6
---
Indonesian T5 Summarization Base Model
Finetuned T5 base summarization model for Indonesian.
Finetuning Corpus
t5-base-indonesian-summarization-cased model is based on t5-base-bahasa-summarization-cased by huseinzol05, finetuned using id_liputan6 dataset.
Load Finetuned Model
from transformers import T5Tokenizer, T5Model, T5ForConditionalGeneration
tokenizer = T5Tokenizer.from_pretrained("cahya/t5-base-indonesian-summarization-cased")
model = T5ForConditionalGeneration.from_pretrained("cahya/t5-base-indonesian-summarization-cased")
Code Sample
from transformers import T5Tokenizer, T5ForConditionalGeneration
tokenizer = T5Tokenizer.from_pretrained("cahya/t5-base-indonesian-summarization-cased")
model = T5ForConditionalGeneration.from_pretrained("cahya/t5-base-indonesian-summarization-cased")
#
ARTICLE_TO_SUMMARIZE = ""
generate summary
input_ids = tokenizer.encode(ARTICLE_TO_SUMMARIZE, return_tensors='pt')
summary_ids = model.generate(input_ids,
min_length=20,
max_length=80,
num_beams=10,
repetition_penalty=2.5,
length_penalty=1.0,
early_stopping=True,
no_repeat_ngram_size=2,
use_cache=True,
do_sample = True,
temperature = 0.8,
top_k = 50,
top_p = 0.95)
summary_text = tokenizer.decode(summary_ids[0], skip_special_tokens=True)
print(summary_text)
Output: