paraphrase multilingual MiniLM L12 v2 onnx Q

提供商Qdrant
分类text2text-generation
许可证apache-2.0
下载量499.0K
星标0

简介

这是一个经过 ONNX 量化优化的轻量级多语言文本向量模型。它并非用于生成对话,而是将文本转化为高维向量(Embedding),核心能力在于语义匹配。由于采用了 MiniLM 架构并进行了量化处理,它在保持较高检索精度的同时,极大地降低了内存占用并提升了推理速度。对于开发者来说,它是构建本地 RAG(检索增强生成)系统、语义搜索或文档去重的理想选择,尤其适合部署在资源受限的边缘端或对响应延迟要求极高的生产环境,可作为 Qdrant 等向量数据库的配套编码器使用。

核心亮点

  • 轻量化 ONNX 量化,极低延迟且节省内存
  • 支持多语言语义向量化,适用于跨语言检索
  • RAG 架构理想的 Embedding 模型,适配 Qdrant
  • 部署门槛低,适合边缘端或高并发实时场景

使用方法

安装依赖
# 安装 Hugging Face transformers
pip install transformers torch
SDK 使用
# 使用 transformers 加载模型
from transformers import AutoModel, AutoTokenizer

model = AutoModel.from_pretrained("Qdrant/paraphrase-multilingual-MiniLM-L12-v2-onnx-Q")
tokenizer = AutoTokenizer.from_pretrained("Qdrant/paraphrase-multilingual-MiniLM-L12-v2-onnx-Q")

Hugging Face 下载

我们推荐使用命令行或者 Hugging Face Hub SDK 来进行模型的下载。

操作指引:在下载前,请先通过如下命令安装 huggingface_hub:

操作指引
pip install -U huggingface_hub

命令行下载

下载完整模型库

下载完整模型库
huggingface-cli download Qdrant/paraphrase-multilingual-MiniLM-L12-v2-onnx-Q

下载单个文件到指定本地文件夹(以下载 config.json 到当前路径下 ./dir 目录为例)

下载单个文件到指定本地文件夹(以下载 config.json 到当前路径下 ./dir 目录为例)
huggingface-cli download Qdrant/paraphrase-multilingual-MiniLM-L12-v2-onnx-Q config.json --local-dir ./dir

更多命令行下载选项,可参见官方文档

SDK 下载

SDK 下载
# 模型下载
from huggingface_hub import snapshot_download
model_dir = snapshot_download('Qdrant/paraphrase-multilingual-MiniLM-L12-v2-onnx-Q')

Git 下载

请确保 lfs 已经被正确安装

Git 下载
git lfs install
git clone https://huggingface.co/Qdrant/paraphrase-multilingual-MiniLM-L12-v2-onnx-Q

如果您希望跳过 lfs 大文件下载,可以使用如下命令

跳过 LFS
GIT_LFS_SKIP_SMUDGE=1 git clone https://huggingface.co/Qdrant/paraphrase-multilingual-MiniLM-L12-v2-onnx-Q

模型文件托管在 Hugging Face Hub,使用 HF CLI / SDK / Git 直接下载,不经过本站。

PyTorch / Transformers 使用

安装 Transformers

安装 Transformers
pip install -U transformers torch

模型加载和推理

模型加载和推理
from transformers import AutoModelForCausalLM, AutoTokenizer

model = AutoModelForCausalLM.from_pretrained('Qdrant/paraphrase-multilingual-MiniLM-L12-v2-onnx-Q')
tokenizer = AutoTokenizer.from_pretrained('Qdrant/paraphrase-multilingual-MiniLM-L12-v2-onnx-Q')

完整文档

来源: HuggingFace

---
license: apache-2.0
pipeline_tag: sentence-similarity
---

Quantized ONNX port of sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2 for text classification and similarity searches.

Usage

Here's an example of performing inference using the model with FastEmbed.

py
from fastembed import TextEmbedding

documents = [
"You should stay, study and sprint.",
"History can only prepare us to be surprised yet again.",
]

model = TextEmbedding(model_name="sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2")
embeddings = list(model.embed(documents))

[

array([1.96449570e-02, 1.60677675e-02, 4.10149433e-02...]),

array([-1.56669170e-02, -1.66313536e-02, -6.84525725e-03...])

]