Yi 开源双语大模型从 0 到 1:安装、推理到微调的完整新手教程
Yi 开源双语大模型从 0 到 1安装、推理到微调的完整新手教程【免费下载链接】YiA series of large language models trained from scratch by developers 01-ai项目地址: https://gitcode.com/GitHub_Trending/yi/YiYi 是 01.AI 从零训练非 Llama 衍生品的开源中英双语大语言模型系列覆盖 6B / 9B / 34B 多种规格配套官方的推理、微调、量化代码和多模态版本让个人开发者和中小团队也能在自有硬件上跑起来一个表现不俗的开源 LLM。规格齐全Yi-6B / 9B / 34B另有 200K 长上下文版本和多模态的 Yi-VL 版本部署门槛低4-bits 量化版最低 4GB 显存即可运行消费级显卡甚至 MacBook 都能跑兼容主流生态沿用 Llama 架构transformers、Docker、llama.cpp 等工具开箱即用官方工具链仓库自带推理 demo、SFT 微调脚本、AWQ/GPTQ 量化脚本许可友好代码与权重均为 Apache 2.0可免费用于个人、学术和商业场景能力版图Yi 仓库里都有什么能力对应入口关键特性备注Base 文本续写demo/text_generation.py支持流式输出、多卡张量并行续写模式非对话模式Chat 对话推理demo/web_demo.py一行命令起 Web 聊天界面可调系统提示、温度等仅 Chat 模型支持长上下文Yi-6B-200K / Yi-34B-200K200K token 上下文约 40 万汉字34B-200K 需 4 x A800 级别显存多模态视觉问答VL/single_inference.py、VL/cli.pyYi-VL-6B / 34B支持命令行、Web demo、OpenAI 风格 API发布时 MMMU / CMMMU 基准第一2024 年 1 月量化压缩quantization/ 下 AWQ、GPTQ 脚本后训练量化4-bits 版最低 4GB 显存精度会下降几个百分点SFT 微调finetune/scripts/ 下run_sft_Yi_6b.sh等官方微调 评估脚本支持自定义 jsonl 数据6B 建议 4 卡 x 60GB34B 全参需 8 x 80GB本地 CPU/低功耗推理llama.cpp GGUF 权重仓库提供教程MacBook Pro16GB / M2 Pro可跑 2-bit 量化版参考 docs/README_llama.cpp.md跑通最小闭环3 步拿到第一条模型回复先说结论有 A80080GB级别的卡走 pip / Docker 路线只有 MacBook 这类设备直接走 llama.cpp GGUF 量化权重。官方给出的学习路径选择图如下第 1 步拿到代码并装依赖需 Python 3.10git clone https://gitcode.com/GitHub_Trending/yi/Yi cd Yi pip install -r requirements.txt也可以用官方 Docker 镜像替代本地环境docker run -it --gpus all -v your-model-path:/models ghcr.io/01-ai/yi:latest第 2 步下载模型权重。模型托管在 Hugging Face、ModelScope魔搭、WiseModel 等平台选对应规格下载即可如Yi-6B-Chat小显存选 4-bits 量化版。第 3 步写一个最小推理脚本保存为quick_start.py并运行from transformers import AutoModelForCausalLM, AutoTokenizer model_path your-model-path # 替换为本地模型路径 tokenizer AutoTokenizer.from_pretrained(model_path, use_fastFalse) model AutoModelForCausalLM.from_pretrained( model_path, device_mapauto, torch_dtypeauto ).eval() # 走 chat 模板把 hi 发给模型 messages [{role: user, content: hi}] input_ids tokenizer.apply_chat_template( messages, tokenizeTrue, add_generation_promptTrue, return_tensorspt) output_ids model.generate(input_ids.to(cuda)) response tokenizer.decode(output_ids[0][input_ids.shape[1]:], skip_special_tokensTrue) print(response) # 例如: Hello! How can I assist you today?python quick_start.py跑通后你就完成了 Yi 部署的最小闭环 后面所有玩法都是在这个基础上加功能。实战示例从 Web 界面到多模态场景 1一条命令拉起 Web 聊天界面适合想快速演示或给团队试用 Chat 模型的情况。注意Web demo 只支持 Chat 模型Base 模型不行python demo/web_demo.py -c 你的模型路径命令执行完按控制台提示的网址访问浏览器即可。Base 模型想体验多卡推理的话用张量并行脚本2 卡示例来自 demo/README.mdtorchrun --nproc_per_node 2 text_generation_tp.py \ --model 01-ai/Yi-6B --max-tokens 512 --streaming场景 2用 Yi-VL 做多模态图片问答Yi-VL视觉语言模型能看图说话。先按 VL/README.md 装好 VL 依赖然后用仓库自带的示例图提问cd VL export PYTHONPATH$PYTHONPATH:$(pwd) pip install -r requirements.txt CUDA_VISIBLE_DEVICES0 python single_inference.py \ --model-path path-to-yi-vl-model \ --image-file images/cats.jpg \ --question Describe the cats and what they are doing in detail.上面这条命令做的事加载 Yi-VL 权重把cats.jpg和问题一起喂给模型得到一段对图中三只猫行为的详细描述。想要持续对话把入口换成 VL/cli.py想对外提供服务用 VL/openai_api.py 起一个 OpenAI 风格的 API。场景 3量化与微调把模型改小或改专量化显存不够时把模型压成低位。官方脚本支持 AWQ 和 GPTQ 两种方式例如python quantization/awq/quant_autoawq.py \ --model /base_model --output_dir /quantized_model --trust_remote_code更细的参数说明看 quantization/awq/README.md 和 quantization/gptq/README.md。微调用官方 SFT 脚本在自有数据上训练数据为promptchosen两字段的 jsonl示例见 finetune/yi_example_dataset/bash finetune/scripts/run_sft_Yi_6b.sh # 微调 bash finetune/scripts/run_eval.sh # 对比微调前后效果微调的完整流程含 Docker 方式、硬件配置建议在 finetune/README.md 里。选型前必须知道的边界与限制先给结论要中文场景、要代码数学能力、要在消费级显卡上跑Yi 值得用要单机跑 200K 长文本、或追求极致稳定的确定性输出要先掂量硬件和预期。显存要求推理最低显存模型最低显存参考 GPU 配置Yi-6B-Chat15 GB1 x RTX 3090 / 4090Yi-6B-Chat-4bits4 GB1 x RTX 3060 / 4060Yi-9B20 GB1 x RTX 4090Yi-34B-Chat72 GB1 x A800 80GB 或 4 x RTX 4090Yi-34B-Chat-4bits20 GB1 x RTX 3090 / 4090Yi-34B-200K200 GB4 x A800 80GB已知限制官方 FAQ 里明说的⚠️ Chat 模型训练时鼓励回复多样化副作用是幻觉、重新生成不一致、长推理中误差累积的概率更高建议调低温度 / top_p / top_k 来换一致性量化版 benchmark 会有几个百分点的性能下降逻辑推理类任务对这点差异尤其敏感34B 全参数微调需要 8 x 80GB 显卡LoRA 类低资源方案成本低得多默认上下文 4K200K 是单独的 200K 版本模型不是免费送的性能底牌官方基准中 Yi-34B-Chat 在 MMLU、CMMLU、BBH、GSM8k 等主流开源模型对比里处于第一梯队Yi-34B 曾在 Hugging Face Open LLM Leaderboard 与 C-Eval 上登顶数据截至 2023 年底。延伸阅读完整中文文档README_CN.md推理示例含张量并行demo/多模态 Yi-VL 文档VL/README.md微调指南finetune/README.md量化脚本说明quantization/awq/README.md、quantization/gptq/README.mdllama.cpp 本地部署教程docs/README_llama.cpp.md社区教程与最佳实践合集RAG、Function Calling、Ollama 等Cookbook/README.md【免费下载链接】YiA series of large language models trained from scratch by developers 01-ai项目地址: https://gitcode.com/GitHub_Trending/yi/Yi创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

UE5 FAsyncTask与GetStatId:任务类实现与线程池正确用法

UE5 FAsyncTask与GetStatId:任务类实现与线程池正确用法

1. 为什么要用AsyncTask而不是直接开一个FRunnable线程 先把场景聊透。很多刚接触UE5多线程的开发者,第一反应是回去用C标准库的std::thread,或者自己在引擎里new一个FRunnable再包一层FRunnableThread,觉得这样“可控、灵活”。这种做法本身…

2026/9/20 2:24:50 阅读更多 →
Gitee生态下的软件成分分析(SCA)落地实践与工具选型指南

Gitee生态下的软件成分分析(SCA)落地实践与工具选型指南

软件成分分析(SCA)这几年几乎成了技术团队绕不开的话题。我自己第一次认真研究它,是团队一个内部管理系统被安全部门通报——线上版本里引用的一个开源组件存在公开已知漏洞,修复时发现组件版本已经非常旧,牵扯到十几个…

2026/9/20 2:24:50 阅读更多 →
Rome useTemplate 规则详解:用模板字符串替代字符串拼接的检测与自动修复

Rome useTemplate 规则详解:用模板字符串替代字符串拼接的检测与自动修复

Rome useTemplate 规则详解:用模板字符串替代字符串拼接的检测与自动修复 【免费下载链接】tools Unified developer tools for JavaScript, TypeScript, and the web 项目地址: https://gitcode.com/gh_mirrors/to/tools Rome(当前仓库 tools&am…

2026/9/20 2:24:50 阅读更多 →

最新新闻

2026年AI编程工具版图:从补全代码到数字员工的五大阵营解析

2026年AI编程工具版图:从补全代码到数字员工的五大阵营解析

1. 2026年AI编程工具的版图:从“补全代码”到“数字员工”的演变年初整理自己电脑上装的一堆AI编程插件时,我发现一个很有意思的现象:三年前大家口中所谓的“AI编程工具”,默认指的就是GitHub Copilot那种在你敲代码时自动补全下半…

2026/9/20 3:14:15 阅读更多 →
夸克网盘下载限速怎么破?在线解析与直链提取提速方案详解

夸克网盘下载限速怎么破?在线解析与直链提取提速方案详解

网盘限速这件事,几乎每个重度用户都经历过。明明家里宽带跑满能到几百兆,下载网盘里的文件却只有几百KB,一个几GB的安装包要挂一整晚。夸克网盘因为空间给得大方、资源分享活跃,用的人越来越多,但"下载慢"的…

2026/9/20 3:14:15 阅读更多 →
LibreChat自托管部署实战:多模型AI对话中台配置与问题排查

LibreChat自托管部署实战:多模型AI对话中台配置与问题排查

1. 为什么我最终选择了LibreChat作为AI对话中台第一次接触LibreChat是在一个需要同时对接多个大模型接口的项目里。当时团队内部有做文案的、写代码的、做数据分析的,每个人习惯用的模型不一样,有人偏爱某家的长文本能力,有人觉得另一家的代码…

2026/9/20 3:14:15 阅读更多 →
RapidOCR 完整上手指南:从安装到多语言识别的三步路

RapidOCR 完整上手指南:从安装到多语言识别的三步路

RapidOCR 完整上手指南:从安装到多语言识别的三步路 【免费下载链接】RapidOCR 📄 Awesome OCR multiple programing languages toolkits based on ONNX Runtime, OpenVINO, MNN, PaddlePaddle, TensorRT and PyTorch. 项目地址: https://gitcode.com/…

2026/9/20 3:14:15 阅读更多 →
如何 5 分钟从零搭好你的第一个多智能体系统:Multi-Agent Orchestrator 快速上手指南

如何 5 分钟从零搭好你的第一个多智能体系统:Multi-Agent Orchestrator 快速上手指南

如何 5 分钟从零搭好你的第一个多智能体系统:Multi-Agent Orchestrator 快速上手指南 【免费下载链接】agent-squad Flexible and powerful framework for managing multiple AI agents and handling complex conversations 项目地址: https://gitcode.com/GitHub…

2026/9/20 3:14:15 阅读更多 →
LinkSwift 网盘直链解析指南:安装到拿到直链全流程

LinkSwift 网盘直链解析指南:安装到拿到直链全流程

LinkSwift 网盘直链解析指南:安装到拿到直链全流程 【免费下载链接】Online-disk-direct-link-download-assistant 一个基于 JavaScript 的网盘文件下载地址获取工具。基于【网盘直链下载助手】修改 ,支持 百度网盘 / 阿里云盘 / 中国移动云盘 / 天翼云盘…

2026/9/20 3:13:15 阅读更多 →

日新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/20 0:00:46 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/20 0:00:46 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/20 0:00:46 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/20 0:00:46 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/20 0:00:46 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/20 0:00:46 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/19 23:01:36 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/19 17:50:38 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/19 23:35:34 阅读更多 →