train-sentence-transformers - base_model_selection
基座模型选择排行榜每几个月就会轮换不要相信任何硬编码的最佳选择。实时发现当前选项——同时运行两种排序因为下载最多展示的是经过验证的选项而趋势展示的是可能还没有下载量的近期 SOTA。发现命令[BI]双编码器hf models list--filtersentence-transformers--sortdownloads--limit20hf models list--filtersentence-transformers--sorttrending--limit20[CE]交叉编码器hf models list--filtersentence-transformers--filtertext-ranking--sortdownloads--limit20hf models list--filtersentence-transformers--filtertext-ranking--sorttrending--limit20[SPARSE]稀疏编码器hf models list--filtersentence-transformers--filtersparse-encoder--sortdownloads--limit20hf models list--filtersentence-transformers--filtersparse-encoder--sorttrending--limit20可选的语言缩小任何类型添加--filter language-code。并非所有多语言模型都会为每种语言打标签所以没有匹配并不代表模型不能处理该语言——去掉过滤器重新运行进行比较。hf models cardid--text# 确认维度、max_seq_length、许可证、语言在投入数小时的运行之前交叉核对 MTEB 排行榜选择相关标签页。[BI] 双编码器从现有检索器继续训练优于全新开始 100k–500k 对数据。截至 2026-Q2 的常见命名空间请对照发现命令验证——领域在轮换英文编码器检索器sentence-transformers/all-*MiniLM-L6-v2、mpnet-base-v2 仍是 Hub 上下载最多的模型、BAAI/bge-*-en-v1.5、nomic-ai/nomic-embed-text-v1.5、mixedbread-ai/mxbai-embed-large-v1、Alibaba-NLP/gte-*、Snowflake/snowflake-arctic-embed-*、jinaai/jina-embeddings-v5-text-small/-nano、microsoft/harrier-oss-v1-270m/-0.6b。多语言编码器检索器sentence-transformers/paraphrase-multilingual-*、intfloat/multilingual-e5-*、ibm-granite/granite-embedding-*-multilingual-r2、google/embeddinggemma-300m、voyageai/voyage-4-nano。长文档8knomic-ai/modernbert-embed-*、answerdotai/ModernBERT-large。解码器 LLM 检索器多语言需要最后 token 池化Qwen/Qwen3-Embedding-*0.6B / 4B / 8B、Qwen/Qwen3-VL-Embedding-*多模态、codefuse-ai/F2LLM-v2-*。全新开始英文≥500k 对 领域契合的理由microsoft/mpnet-base、answerdotai/ModernBERT-base、google-bert/bert-base-uncased、jhu-clsp/ettin-encoder-*17m / 32m / 68m / 150m / 400m / 1b —— 配对的 ModernBERT 编码器系列。全新开始多语言FacebookAI/xlm-roberta-base仅 MLM需要对比训练、microsoft/mdeberta-v3-base、jhu-clsp/mmBERT-base/-small。CPU / 小占用StaticEmbeddingStaticEmbedding(tokenizer, embedding_dim...)。模型大小 vocab_size × dim × 4 字节—— 选择小词汇量的分词器否则会得到巨型模型30k 词汇量的bert-base-uncased× 128 维 ≈ 15 MB250k 词汇量的paraphrase-multilingual-MiniLM-L12-v2× 256 维 ≈ 256 MB。随机初始化需要 100 万 对数据在 ~10 万对以下时热启动StaticEmbedding.from_distillation(...)有帮助。架构变体编码器 / 解码器 / 静态 / Router、池化规则、以及解码器 vs 编码器的设置路径见model_architectures.md。ModernBERT 家族基座默认max_seq_length8192。这会为 8192 token 的序列分配激活内存无论你的数据长度如何并会悄然把 Windows VRAM 推向共享内存溢出。在加载任何 ModernBERT / mmBERT / Ettin / gte-modernbert / nomic-modernbert 基座后显式设置model.max_seq_length 256文档则为 512除非你确实需要长上下文。[CE] 交叉编码器在大多数领域从现有重排器继续训练优于全新开始 100k–500k 对数据默认这样做除非你有充分理由不这么做。截至 2026-Q2 的常见命名空间英文编码器重排器cross-encoder/ms-marco-*、BAAI/bge-reranker-*、mixedbread-ai/mxbai-rerank-*-v1/-v2、Alibaba-NLP/gte-reranker-modernbert-*、ibm-granite/granite-embedding-reranker-english-*。多语言编码器重排器cross-encoder/mmarco-*、BAAI/bge-reranker-v2-m3、Alibaba-NLP/gte-multilingual-reranker-*、ibm-granite/granite-embedding-reranker-multilingual-*。解码器 LLM 重排器多语言num_labels1的 last-token 风格打分Qwen/Qwen3-Reranker-*0.6B / 4B / 8B、Qwen/Qwen3-VL-Reranker-*多模态。全新开始microsoft/MiniLM-L12-H384-uncased、answerdotai/ModernBERT-base/-large、jhu-clsp/ettin-encoder-*、FacebookAI/xlm-roberta-base多语言、microsoft/mdeberta-v3-base多语言、jhu-clsp/mmBERT-base/-small多语言。分类交叉编码器需传入num_labels 2。纯编码器基座仍是延迟效率高的默认选择在小参数规模下双向注意力非常适合重排用例但当延迟/内存预算允许时解码器 LLM 重排器现在在 MTEB Reranking 榜单顶部具有竞争力。最小数据集生产环境需要 50 万 条带标签的(query, passage, label)元组在领域数据上继续训练需要 1 万–10 万条带标签的对。低资源语言可能少于 1 万条带标签的对在这种情况下依靠多语言基座的预训练并接受更嘈杂的信号。小多语言模型约为 1 亿 参数不像英文小模型那样是 17M-50M。mMiniLMv2-L12-H384约 117M大致是可用的多语言重排器的小型端。[SPARSE] 稀疏编码器SPLADESPLADE 需要 fill-mask /AutoModelForMaskedLM兼容的检查点。纯编码器 MLM 模型开箱即用解码器 LLM 不行。从现有 SPLADE 继续——英文naver/splade-*规范系列、opensearch-project/opensearch-neural-sparse-encoding-*包括-doc-v2-distill、-doc-v3-distill/-doc-v3-gte、prithivida/Splade_PP_en_v*、ibm-granite/granite-embedding-30m-sparse。从现有 SPLADE 继续——多语言opensearch-project/opensearch-neural-sparse-encoding-multilingual-v1。全新开始英文≥50 万对任何带 MLM 头的编码器——distilbert/distilbert-base-uncased、google-bert/bert-base-uncased。没有 MLM 的纯AutoModel检查点不行。发现 MLM 基座hf models list --filter fill-mask --sort downloads --limit 20。全新开始多语言FacebookAI/xlm-roberta-base有 MLM 头。其他多语言 MLM 基座添加--filter language-code。最小数据集具有竞争力的 SPLADE 需要 50 万 三元组带挖掘的困难负样本在现有 SPLADE 上进行领域适配需要 5 万 三元组。跨领域提示非英文检索起点当语言标签返回 0 个结果时查看intfloat/multilingual_e5_train_data获取平行对数据通过sentence-transformers/miracl镜像获取多语言检索用的 MIRACL通过unicamp-dl/mmarco获取 mMARCO14 种语言parquet 后端。避免基于脚本的数据集加载器。datasets 4会以RuntimeError: Dataset scripts are no longer supported拒绝它们。寻找 parquet 后端的镜像例如用sentence-transformers/miracl而不是miracl/miracl。hf datasets sql需要 DuckDBpip install duckdb。没有它就回退到python -c from datasets import load_dataset; ds load_dataset(id, ...); print(ds.column_names, ds[0])。

相关新闻

《WiFi 嵌入式物联网开发全套实战》| 第 27 章 WiFi 信号弱、速率暴跌、信道拥堵优化方案

《WiFi 嵌入式物联网开发全套实战》| 第 27 章 WiFi 信号弱、速率暴跌、信道拥堵优化方案

专栏:《WiFi 嵌入式物联网开发全套实战》专栏定位:嵌入式 Linux/ESP32 WiFi 从原理→驱动→配网→协议→稳定性→抓包调试→量产优化全套工业实战适配:物联网设备、智能家居、工控网关、无线透传设备、4GWiFi 双模设备💖 点赞 收…

2026/10/3 17:38:01 阅读更多 →
Godot 窗口管理与 DisplayServer 完整实战指南:window_management 演示项目深度解析

Godot 窗口管理与 DisplayServer 完整实战指南:window_management 演示项目深度解析

示例工程 【免费下载链接】godot-demo-projects Demonstration and Template Projects 项目地址: https://gitcode.com/GitHub_Trending/go/godot-demo-projects 点击查看 免费下载 本文基于 godot-demo-projects 仓库中的 window_management 演示项目,…

2026/10/3 17:37:00 阅读更多 →
Kinsta 远程办公档案全解析:remoteintech.company 中 fully-remote 公司条目的数据模型与工程实践

Kinsta 远程办公档案全解析:remoteintech.company 中 fully-remote 公司条目的数据模型与工程实践

数据集 【免费下载链接】remote-jobs Source for remoteintech.company — a community-maintained directory of remote-friendly tech companies 项目地址: https://gitcode.com/GitHub_Trending/re/remote-jobs 点击查看 免费下载 Kinsta 是 remoteintech.compa…

2026/10/3 17:37:00 阅读更多 →

最新新闻

AI Agent工具接入层设计:订阅路由与代理式认证注入实战

AI Agent工具接入层设计:订阅路由与代理式认证注入实战

如果你手头正在搞 AI Agent,那你早晚会撞上这样一个场景:Agent 本身没写几行,工具接入却写了两千行。大模型决定的是上限,工具接入决定的是下限,真正让 Agent “下地干活”的那一层,往往被各种 API 密钥、供…

2026/10/3 18:53:43 阅读更多 →
智能体工程化:从Demo到落地的关键实践与避坑指南

智能体工程化:从Demo到落地的关键实践与避坑指南

1. 这一周的趋势信号:智能体项目集体"变重" 这周的 GitHub Trending 我刷得比平时慢,因为榜单里的东西明显变"重"了。过去一屏扫过去,智能体相关的项目大多是聊天 Demo、Prompt 合集、单机脚本,star 涨得飞快…

2026/10/3 18:53:43 阅读更多 →
从输入风速到脉动风速:生成、拆解与空间相关性实战

从输入风速到脉动风速:生成、拆解与空间相关性实战

简介:这份资源面向风工程与流体仿真方向的学习者,聚焦ANSYS Fluent中用户自定义入口风速的实现,尤其是脉动风速的输入与时间插值计算。资源包共2个文件,包含1个cpp源码与1个txt数据文件,压缩包约3KB,体量轻…

2026/10/3 18:53:43 阅读更多 →
Unreal引擎开发踩坑实录:编译、资产、光照与打包问题全解析

Unreal引擎开发踩坑实录:编译、资产、光照与打包问题全解析

做Unreal引擎开发这几年,我最大的感受是:一半时间在写功能,另一半时间在和引擎本身较劲。不管是版本升级、换了新项目组,还是打包上线前夜,总有几个问题能让你从早折腾到晚。这篇内容是我在实际项目里遇到的问题记录整…

2026/10/3 18:53:42 阅读更多 →
ROS2+YOLO+MoveIt!机械臂视觉抓取仿真全流程

ROS2+YOLO+MoveIt!机械臂视觉抓取仿真全流程

做机械臂视觉抓取,最容易被卡住的地方不是某一个算法多难,而是环节之间接不上:YOLO检测框出来了,但不知道它对应的空间坐标在哪;手动给机械臂发了抓取指令,却不知道它会不会撞到桌面;轨迹规划好…

2026/10/3 18:53:42 阅读更多 →
游戏逆向工程与反作弊攻防:从内存分析到协议逆向的技术全景

游戏逆向工程与反作弊攻防:从内存分析到协议逆向的技术全景

1. 游戏逆向工程到底在做什么 很多人第一次听到“游戏逆向工程”这个词,脑子里浮现的画面要么是外挂作者在破解游戏,要么是黑客在搞破坏。实际上,这个领域远比想象中复杂,也远比想象中正经。我在这行摸爬滚打十来年,接…

2026/10/3 18:52:41 阅读更多 →

日新闻

把回忆蒸馏成 AI 的浪漫实验:为什么你需要前任.skill 完整指南

把回忆蒸馏成 AI 的浪漫实验:为什么你需要前任.skill 完整指南

把回忆蒸馏成 AI 的浪漫实验:为什么你需要前任.skill 完整指南 【免费下载链接】ex-skill 前任 skill 项目地址: https://gitcode.com/gh_mirrors/exsk/ex-skill 前任.skill 是一个运行在 Claude Code 上的开源 Skill:导入微信、iMessage、短信、…

2026/10/3 0:00:27 阅读更多 →
45个经典Linux面试题:从命令到网络排障的完整考点解析

45个经典Linux面试题:从命令到网络排障的完整考点解析

刚开始带应届生的时候,我最头疼的就是他们拿着一摞Linux面试题背得滚瓜烂熟,一上机全露馅。后来自己从被面的人变成面别人的人,才慢慢摸清楚:Linux面试题考的根本不是答案本身,而是你面对一个不确定的系统问题时&#…

2026/10/3 0:01:28 阅读更多 →
SAP生产预留实战指南:MB21/MB23/MB25协同与MRP集成

SAP生产预留实战指南:MB21/MB23/MB25协同与MRP集成

简介:本资源是一份面向SAP ABAP开发人员、生产计划专员及ERP实施顾问的实操型操作指南,聚焦SAP生产预留核心业务场景,系统解决物料预留创建、查询、校验与批量处理等高频问题。文档以结构化方式覆盖预留背景原理、OMC2编码规则、工厂级参数配…

2026/10/3 0:01:28 阅读更多 →

周新闻

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解 【免费下载链接】spirula-studio Cross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA. 项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio Sp…

2026/10/3 9:14:33 阅读更多 →
SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南 模板网站太丑不够用?别急着加滤镜,那是治标不治本。很多老板盯着后台流量掉得眼红,却还在纠结首页Banner的圆角是不是3像素。这就像穿着西装去挖土,姿势不对,努力白费。我整理这份 速查手册…

2026/10/3 9:47:50 阅读更多 →
FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏 【免费下载链接】FireRed-OpenStoryline FireRed-OpenStoryline is an AI video editing agent that transforms manual editing into intention-driven directing through natural language …

2026/10/3 9:42:31 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/2 10:36:31 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/3 9:42:35 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/3 9:42:36 阅读更多 →