AI SeedbankHelp preserve open and free AI for humanity's future

← All models

shibing624_text2vec-base-chinese

shibing624 · View on Hugging Face ↗

Get this model

Download TorrentMagnet Link

Seeders: · Leechers:

Model card

The complete upstream card, rendered from this payload's README.md — the same hash-verified bytes the torrent distributes. Images and off-site links are removed; the original card on Hugging Face carries them.


license: apache-2.0 pipeline_tag: sentence-similarity tags:

  • Sentence Transformers
  • sentence-similarity
  • sentence-transformers datasets:
  • shibing624/nli_zh language:
  • zh library_name: sentence-transformers

shibing624/text2vec-base-chinese

This is a CoSENT(Cosine Sentence) model: shibing624/text2vec-base-chinese.

It maps sentences to a 768 dimensional dense vector space and can be used for tasks like sentence embeddings, text matching or semantic search.

Evaluation

For an automated evaluation of this model, see the Evaluation Benchmark: text2vec

  • chinese text matching task:
Arch BaseModel Model ATEC BQ LCQMC PAWSX STS-B SOHU-dd SOHU-dc Avg QPS
Word2Vec word2vec w2v-light-tencent-chinese 20.00 31.49 59.46 2.57 55.78 55.04 20.70 35.03 23769
SBERT xlm-roberta-base sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2 18.42 38.52 63.96 10.14 78.90 63.01 52.28 46.46 3138
Instructor hfl/chinese-roberta-wwm-ext moka-ai/m3e-base 41.27 63.81 74.87 12.20 76.96 75.83 60.55 57.93 2980
CoSENT hfl/chinese-macbert-base shibing624/text2vec-base-chinese 31.93 42.67 70.16 17.21 79.30 70.27 50.42 51.61 3008
CoSENT hfl/chinese-lert-large GanymedeNil/text2vec-large-chinese 32.61 44.59 69.30 14.51 79.44 73.01 59.04 53.12 2092
CoSENT nghuyong/ernie-3.0-base-zh shibing624/text2vec-base-chinese-sentence 43.37 61.43 73.48 38.90 78.25 70.60 53.08 59.87 3089
CoSENT nghuyong/ernie-3.0-base-zh shibing624/text2vec-base-chinese-paraphrase 44.89 63.58 74.24 40.90 78.93 76.70 63.30 63.08 3066
CoSENT sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2 shibing624/text2vec-base-multilingual 32.39 50.33 65.64 32.56 74.45 68.88 51.17 53.67 4004

说明:

  • 结果评测指标:spearman系数
  • shibing624/text2vec-base-chinese模型,是用CoSENT方法训练,基于hfl/chinese-macbert-base在中文STS-B数据训练得到,并在中文STS-B测试集评估达到较好效果,运行examples/training_sup_text_matching_model.py代码可训练模型,模型文件已经上传HF model hub,中文通用语义匹配任务推荐使用
  • shibing624/text2vec-base-chinese-sentence模型,是用CoSENT方法训练,基于nghuyong/ernie-3.0-base-zh用人工挑选后的中文STS数据集shibing624/nli-zh-all/text2vec-base-chinese-sentence-dataset训练得到,并在中文各NLI测试集评估达到较好效果,运行examples/training_sup_text_matching_model_jsonl_data.py代码可训练模型,模型文件已经上传HF model hub,中文s2s(句子vs句子)语义匹配任务推荐使用
  • shibing624/text2vec-base-chinese-paraphrase模型,是用CoSENT方法训练,基于nghuyong/ernie-3.0-base-zh用人工挑选后的中文STS数据集shibing624/nli-zh-all/text2vec-base-chinese-paraphrase-dataset,数据集相对于shibing624/nli-zh-all/text2vec-base-chinese-sentence-dataset加入了s2p(sentence to paraphrase)数据,强化了其长文本的表征能力,并在中文各NLI测试集评估达到SOTA,运行examples/training_sup_text_matching_model_jsonl_data.py代码可训练模型,模型文件已经上传HF model hub,中文s2p(句子vs段落)语义匹配任务推荐使用
  • sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2模型是用SBERT训练,是paraphrase-MiniLM-L12-v2模型的多语言版本,支持中文、英文等
  • w2v-light-tencent-chinese是腾讯词向量的Word2Vec模型,CPU加载使用,适用于中文字面匹配任务和缺少数据的冷启动情况

Usage (text2vec)

Using this model becomes easy when you have text2vec installed:

pip install -U text2vec

Then you can use the model like this:

from text2vec import SentenceModel
sentences = ['如何更换花呗绑定银行卡', '花呗更改绑定银行卡']

model = SentenceModel('shibing624/text2vec-base-chinese')
embeddings = model.encode(sentences)
print(embeddings)

Usage (HuggingFace Transformers)

Without text2vec, you can use the model like this:

First, you pass your input through the transformer model, then you have to apply the right pooling-operation on-top of the contextualized word embeddings.

Install transformers:

pip install transformers

Then load model and predict:

from transformers import BertTokenizer, BertModel
import torch

# Mean Pooling - Take attention mask into account for correct averaging
def mean_pooling(model_output, attention_mask):
    token_embeddings = model_output[0]  # First element of model_output contains all token embeddings
    input_mask_expanded = attention_mask.unsqueeze(-1).expand(token_embeddings.size()).float()
    return torch.sum(token_embeddings * input_mask_expanded, 1) / torch.clamp(input_mask_expanded.sum(1), min=1e-9)

# Load model from HuggingFace Hub
tokenizer = BertTokenizer.from_pretrained('shibing624/text2vec-base-chinese')
model = BertModel.from_pretrained('shibing624/text2vec-base-chinese')
sentences = ['如何更换花呗绑定银行卡', '花呗更改绑定银行卡']
# Tokenize sentences
encoded_input = tokenizer(sentences, padding=True, truncation=True, return_tensors='pt')

# Compute token embeddings
with torch.no_grad():
    model_output = model(**encoded_input)
# Perform pooling. In this case, mean pooling.
sentence_embeddings = mean_pooling(model_output, encoded_input['attention_mask'])
print("Sentence embeddings:")
print(sentence_embeddings)

Usage (sentence-transformers)

sentence-transformers is a popular library to compute dense vector representations for sentences.

Install sentence-transformers:

pip install -U sentence-transformers

Then load model and predict:

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("shibing624/text2vec-base-chinese")
sentences = ['如何更换花呗绑定银行卡', '花呗更改绑定银行卡']

sentence_embeddings = m.encode(sentences)
print("Sentence embeddings:")
print(sentence_embeddings)

Model speed up

Model ATEC BQ LCQMC PAWSX STSB
shibing624/text2vec-base-chinese (fp32, baseline) 0.31928 0.42672 0.70157 0.17214 0.79296
shibing624/text2vec-base-chinese (onnx-O4, #29) 0.31928 0.42672 0.70157 0.17214 0.79296
shibing624/text2vec-base-chinese (ov, #27) 0.31928 0.42672 0.70157 0.17214 0.79296
shibing624/text2vec-base-chinese (ov-qint8, #30) 0.30778 (-3.60%) 0.43474 (+1.88%) 0.69620 (-0.77%) 0.16662 (-3.20%) 0.79396 (+0.13%)

In short:

  1. ✅ shibing624/text2vec-base-chinese (onnx-O4), ONNX Optimized to O4 does not reduce performance, but gives a ~2x speedup on GPU.
  2. ✅ shibing624/text2vec-base-chinese (ov), OpenVINO does not reduce performance, but gives a 1.12x speedup on CPU.
  3. 🟡 shibing624/text2vec-base-chinese (ov-qint8), int8 quantization with OV incurs a small performance hit on some tasks, and a tiny performance gain on others, when quantizing with Chinese STSB. Additionally, it results in a 4.78x speedup on CPU.
  • usage: shibing624/text2vec-base-chinese (onnx-O4), for gpu
from sentence_transformers import SentenceTransformer

model = SentenceTransformer(
    "shibing624/text2vec-base-chinese",
    backend="onnx",
    model_kwargs={"file_name": "model_O4.onnx"},
)
embeddings = model.encode(["如何更换花呗绑定银行卡", "花呗更改绑定银行卡", "你是谁"])
print(embeddings.shape)
similarities = model.similarity(embeddings, embeddings)
print(similarities)
  • usage: shibing624/text2vec-base-chinese (ov), for cpu
# pip install 'optimum[openvino]'

from sentence_transformers import SentenceTransformer

model = SentenceTransformer(
    "shibing624/text2vec-base-chinese",
    backend="openvino",
)

embeddings = model.encode(["如何更换花呗绑定银行卡", "花呗更改绑定银行卡", "你是谁"])
print(embeddings.shape)
similarities = model.similarity(embeddings, embeddings)
print(similarities)
  • usage: shibing624/text2vec-base-chinese (ov-qint8), for cpu
# pip install optimum
from sentence_transformers import SentenceTransformer

model = SentenceTransformer(
    "shibing624/text2vec-base-chinese",
    backend="onnx",
    model_kwargs={"file_name": "model_qint8_avx512_vnni.onnx"},
)
embeddings = model.encode(["如何更换花呗绑定银行卡", "花呗更改绑定银行卡", "你是谁"])
print(embeddings.shape)
similarities = model.similarity(embeddings, embeddings)
print(similarities)

Full Model Architecture

CoSENT(
  (0): Transformer({'max_seq_length': 128, 'do_lower_case': False}) with Transformer model: BertModel 
  (1): Pooling({'word_embedding_dimension': 768, 'pooling_mode_mean_tokens': True})
)

Intended uses

Our model is intented to be used as a sentence and short paragraph encoder. Given an input text, it ouptuts a vector which captures the semantic information. The sentence vector may be used for information retrieval, clustering or sentence similarity tasks.

By default, input text longer than 256 word pieces is truncated.

Training procedure

Pre-training

We use the pretrained hfl/chinese-macbert-base model. Please refer to the model card for more detailed information about the pre-training procedure.

Fine-tuning

We fine-tune the model using a contrastive objective. Formally, we compute the cosine similarity from each possible sentence pairs from the batch. We then apply the rank loss by comparing with true pairs and false pairs.

Hyper parameters

Citing & Authors

This model was trained by text2vec.

If you find this model helpful, feel free to cite:

@software{text2vec,
  author = {Xu Ming},
  title = {text2vec: A Tool for Text to Vector},
  year = {2022},
  url = {https://github.com/shibing624/text2vec},
}

Magnet link

Opens the swarm directly in your torrent client — no file download needed. Copy-paste works too:

magnet:?xt=urn:btih:2e3ff318af0bc0d88dda4239db288e8f9242ca9c&dn=shibing624_text2vec-base-chinese

Open magnet in torrent client · infohash 2e3ff318af0bc0d88dda4239db288e8f9242ca9c

Files & hashes

PathSizesha1sha256
1_Pooling/config.json74 B (74 B)6cf65ba8116d461a2baa0039d80bbc4b3eb7600b3307e674cc85cf6d18376a57f1958961be178e9e51e18e39e214285082e4892a
README.md13.4 KB (13,700 B)7fac338dfa876bf83d235a13e72b06b21ea4f552a872929117b66405f669cb80dd778e860ae3e3146531a6deb294c5db2e587e33
config.json856 B (856 B)90e03d46bdb660cb7a95fb0200a35e456457f78cfdf4d96b74a9e2dc8ae752d74bcfbbf8b3a754b3d97412477f8768ef65a7db36
logs.txt546 B (546 B)1f2f0a893a53104164569d8ffb65be83219b3ea55bba4a225e7afcc81870a5d3787f1c5215ee3f59614512053f10a90c4d8fd247
model.safetensors390.1 MB (409,098,104 B)e16f697da39bd06dae30245208efdac912c2c3bd0c855515479137398ce4ea985628548d4e8ed8c5764656dac966d6a24f39e721
modules.json230 B (230 B)2c787222b8b9fc64a5a5c6bcf7506e2c4906bec50580fad756940809b1bc064ce1e7c1275c8b0dd80869562fe0abeb6f7059cb97
onnx/config.json836 B (836 B)a61f58c593061a60ebd8643de7973d67e210221a31fedc61f7a714978f9d9849f4818ef905f216dc7791e469b9eceb9b32350b63
onnx/special_tokens_map.json125 B (125 B)a8b3208c2884c4efb86e49300fdd3dc877220cdfb6d346be366a7d1d48332dbc9fdf3bf8960b5d879522b7799ddba59e76237ee3
onnx/tokenizer.json428.8 KB (439,124 B)15df791881f91e7963c9e0d704de2f2037baa0027dfbf1966ebf99d471c3796e9b457329d2b2182b817e144f1e904b957745c839
onnx/tokenizer_config.json394 B (394 B)42046bd361a033a24264dc41de1fe6cafd68072fe1790949631401af1bfb6c9c7aeec7fcf612e274d73579d99f704faea40c8ba7
onnx/vocab.txt107.0 KB (109,540 B)ca4f9781030019ab9b253c6dcb8c7878b6dc87a545bbac6b341c319adc98a532532882e91a9cefc0329aa57bac9ae761c27b291c
openvino/openvino_model.bin387.9 MB (406,712,480 B)81369a3f264d93e6566615575648fdc0c423ec8989c7ee42c7fa333b72fb909171df77601df89c3d73795e4a324515c153b4cbc5
openvino/openvino_model.xml354.8 KB (363,277 B)9ba3f763beb96e7b1e51def222a350c882f66ccfa949015c201eb3633e22ccce1eded06280f38bcf4be995900e569bfb18922468
pytorch_model.bin390.2 MB (409,154,033 B)7e700f30999a2d4a3d6b38ffe340ff96fa6d88d054ff3a857e3efa0b8114eb5e7a9e7e2b6230b4ddb083254a751e44772bb99075
sentence_bert_config.json54 B (54 B)e0021d480d68dfdf363d3639ee7f3c00f63239f7e1e8e1346dfc366ef83522c735098ecf64b5a1cd26d01f83757585e6a7786335
special_tokens_map.json112 B (112 B)e7b0375001f109a6b8873d756ad4f7bbb15fbaa5303df45a03609e4ead04bc3dc1536d0ab19b5358db685b6f3da123d05ec200e3
tokenizer_config.json319 B (319 B)5bdf2723485c9b6e797c26b1c59edf10a638051d3da14b28cdfd6bcb24aef5e16a37c868bc6e8428b4180833d5e0ef9cc19931df
vocab.txt107.0 KB (109,540 B)ca4f9781030019ab9b253c6dcb8c7878b6dc87a545bbac6b341c319adc98a532532882e91a9cefc0329aa57bac9ae761c27b291c

Cite this release

Canonical URL
https://aiseedbank.org/models/shibing624_text2vec-base-chinese/
Slug
shibing624_text2vec-base-chinese
Infohash
2e3ff318af0bc0d88dda4239db288e8f9242ca9c
License
apache-2.0
Signing key fingerprint
85a3b32c3712427b

Every file carries a locally computed sha256 — verify a download against the signed sums: shibing624_text2vec-base-chinese.SHA256SUMS (+ minisign signature).

Provenance

Upstream repositoryshibing624/text2vec-base-chinese
Revision (pinned)183bb99aa7af74355fb58d16edf8c13ae7c5433e
Fetched at2026-09-04T05:39:42Z
License at fetchapache-2.0
Snapshot toolhuggingface · seedbank 0.1.0

Trackers

✓ verified · rehash-vs-hf-metadata at 2026-09-04T05:39:57Z

apache-2.01.14 GB (1,226,003,344 bytes)sentence-transformerspytorchonnxsafetensorsopenvinobertSentence Transformerssentence-similarityendpoints_compatible1 language (zh)