Xinference 10 分钟搭建指南:从单篇文献摘要到 50 篇批量处理
Xinference 10 分钟搭建指南从单篇文献摘要到 50 篇批量处理【免费下载链接】inferenceSwap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.项目地址: https://gitcode.com/GitHub_Trending/in/inference周五下班前桌上堆着 40 篇 PDF明天要交文献综述初稿。用 Xinference 一行命令拉起本地推理服务把 PDF 文本喂给模型自动产出结构化摘要50 篇文献可以批量跑完不用盯着。照下面做完你手上会有三样东西一个跑在 9997 端口的本地推理服务OpenAI 兼容 API现有代码几乎零改动接入、一个能读文献做摘要的模型、一个批量处理脚本。首次启动含模型下载约 5 分钟视网速之后权重本地缓存秒级拉起单篇摘要从人工半小时压到几十秒出稿。Xinference 替你做了什么一句话说清它把下载模型、选推理引擎、起服务、暴露 API这四件事收进一条xinference launch命令。模型是 pytorch 还是 GGUF 格式、该用 vLLM 还是 llama.cpp不用你查兼容表启动前用xinference engine查一下即可。阶段 A5 分钟跑通第一条摘要先装依赖、起服务两条命令# 安装框架[all] 带上全部推理后端依赖 pip install xinference[all] # 启动本地集群默认 9997 端口 xinference-local --host 0.0.0.0 --port 9997浏览器打开http://127.0.0.1:9997就是管理界面/docs路径能看全部 API 文档。界面里可以直接点选模型启动用 Python 客户端拉一个最小的 Qwen2.5 0.5B 跑通链路首次会自动从 HuggingFace 下载权重from xinference.client import RESTfulClient client RESTfulClient(http://127.0.0.1:9997) model_uid client.launch_model( model_nameqwen2.5-instruct, model_enginevllm, model_formatpytorch, size_in_billions0_5, # 先跑通GPU 够再换更大参数 ) model client.get_model(model_uid) print(model.chat(messages[{role: user, content: 把这段话总结成三句话...}]))能打印出回答链路就通了。但 0.5B 做专业文献摘要是心有余力不足接下来要会选引擎和参数。阶段 B选对引擎与量化让它真正能干活的启动前先用engine子命令查目标模型支持哪些引擎组合避免拉起来报错再试# 查询 qwen2.5-instruct 在 vllm 引擎下的可用参数组合 xinference engine -e http://127.0.0.1:9997 \ --model-name qwen2.5-instruct --model-engine vllm不同硬件选引擎的速查引擎适用场景安装方式vllmLinux CUDA吞吐优先pip install xinference[vllm]llama.cpp无 GPU 的笔记本GGUF 量化模型pip install xinference[llama_cpp]transformersCPU 兜底几乎支持所有模型pip install xinference[transformers]MLXApple Silicon性能最好pip install xinference[mlx]这步别跳过下载慢就在启动服务时加环境变量XINFERENCE_MODEL_SRCmodelscope切换源权重默认缓存在~/.xinference可用XINFERENCE_HOME改目录第二次启动不再下载。GPU 机器上给 vLLM 显存占用留点余量引擎专属参数直接跟在命令后面透传# 官方文档同款启动命令--gpu_memory_utilization 会透传给 vLLM xinference launch --model-engine vllm -n qwen2.5-instruct \ -s 0_5 -f pytorch --gpu_memory_utilization 0.9数据接入侧Xinference 暴露的是 OpenAI 兼容接口现有 OpenAI 代码换个 base_url 就能用。用 pypdf 抽文本、按 IMRaD 结构出摘要import pypdf from openai import OpenAI llm OpenAI(base_urlhttp://127.0.0.1:9997/v1, api_keynot used) text \n.join(p.extract_text() for p in pypdf.PdfReader(paper.pdf).pages[:10]) # 只取前 10 页 resp llm.chat.completions.create( modelmodel_uid, messages[{role: user, content: 按 IMRaD 结构(目的/方法/结果/结论)总结\n text}], ) print(resp.choices[0].message.content)单篇跑通只是起点50 篇才是真需求。阶段 C批量、并行与长期运行vllm/sglang 引擎自带连续批处理continuous batching并发请求会自动攒批50 篇并发提交比串行快得多机制详见 连续批处理文档。同模型加--replica 2可多副本并行分流启动时带--metrics-exporter-port 9090暴露 Prometheus 指标接入监控面板。跑完记得xinference terminate --model-uid qwen2.5-instruct释放显存。批量脚本本体很短目录里丢 PDF跑完每篇旁边多一份.summary.mdimport glob from openai import OpenAI llm OpenAI(base_urlhttp://127.0.0.1:9997/v1, api_keynot used) for path in glob.glob(./papers/*.pdf): # PDF 统一放这个目录 text load_pdf_text(path) # pypdf 抽文本前面已定义思路 resp llm.chat.completions.create( modelmodel_uid, messages[{role: user, content: summarize_prompt text}], ) with open(path.replace(.pdf, .summary.md), w) as f: f.write(resp.choices[0].message.content)模型依赖打架时还有个顺手工具Xinference 3.0 支持按模型隔离虚拟环境启动时传enable_virtual_env即可界面里可以直接管理各模型环境。进阶方向要 RAG 检索再拉一个嵌入模型client.launch_model(model_namebge-base-en-v1.5, model_typeembedding)同一套 OpenAI 兼容 API 走/v1/embeddings要单机扛不住用xinference-supervisorxinference-worker组多机集群见 分布式推理指南不想装 Python 环境Docker 直接跑官方镜像见 Docker 部署文档。装框架、起服务、接 OpenAI 接口、配个批量脚本文献摘要流水线就完整了。模型目录与全部参数详见 官方文档。【免费下载链接】inferenceSwap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.项目地址: https://gitcode.com/GitHub_Trending/in/inference创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

ZenML Pro Workspace Server 快照(Workload Manager)支持配置指南

ZenML Pro Workspace Server 快照(Workload Manager)支持配置指南

ZenML Pro Workspace Server 快照(Workload Manager)支持配置指南 【免费下载链接】zenml ZenML 🙏: One AI Platform from Pipelines to Agents. https://zenml.io. 项目地址: https://gitcode.com/GitHub_Trending/ze/zenml 本篇技术…

2026/9/18 22:27:40 阅读更多 →
在 Cloudflare Agents 项目中固化未发布依赖:pi AgentHarness 的 vendored 开发版构建输入解析

在 Cloudflare Agents 项目中固化未发布依赖:pi AgentHarness 的 vendored 开发版构建输入解析

在 Cloudflare Agents 项目中固化未发布依赖:pi AgentHarness 的 vendored 开发版构建输入解析 【免费下载链接】agents Build and deploy AI Agents on Cloudflare 项目地址: https://gitcode.com/GitHub_Trending/agents1/agents 本文围绕 examples/next/h…

2026/9/20 3:32:36 阅读更多 →
我用华为云码道从0到1做出一款战棋游戏:一个周末的完整实战记录

我用华为云码道从0到1做出一款战棋游戏:一个周末的完整实战记录

一键开通华为云码道 CodeArts 代码智能体:https://developer.huaweicloud.com/codeartsco.html?sourcedmzntgwatomgit1&sourceaddmzntgwatomgithd 作品介绍: 本文记录了作者仅用6分37秒,通过华为云码道CodeArts代码智能体,从…

2026/9/18 22:26:40 阅读更多 →

最新新闻

ComfyUI整合包从入门到精通:AI绘画与视频工作流实战指南

ComfyUI整合包从入门到精通:AI绘画与视频工作流实战指南

1. 为什么我最终把主力工作流搬进了 ComfyUI 整合包第一次接触 ComfyUI 的人,十有八九会被那一屏密密麻麻的节点连线劝退。我当初也是这么想的——WebUI 点几下就能出图,何必折腾这种"连线画图"的东西。直到有一次我想复现一个网上看到的工作流…

2026/9/20 3:32:22 阅读更多 →
Cursor AI编码工作流实战:从配置到API接入与规则文件

Cursor AI编码工作流实战:从配置到API接入与规则文件

过去大半年,我把手头几乎所有实际项目都迁到了 Cursor 上,从几十行的数据清洗脚本到前后端齐全的全栈项目。刚开始它就是一个"能自动补全的编辑器",直到我把大模型 API 的接入方式、规则文件、AI 会话的工作方式全部理顺之后&#…

2026/9/20 3:32:22 阅读更多 →
雅虎邮箱停服后:docx手册拆解邮箱登录名校验与MX排查

雅虎邮箱停服后:docx手册拆解邮箱登录名校验与MX排查

简介:这份文档面向需要在淘宝开店或网购、却对注册流程不熟悉的新手用户,系统梳理了用邮箱注册淘宝账户并同步开通支付宝的完整路径。作者把注册拆解为进入淘宝点击新用户注册、填写用户名与密码手机号、切换邮箱验证、填写邮箱地址并勾选同步创建支付宝…

2026/9/20 3:32:22 阅读更多 →
2026年VSCode插件清单:AI编程与Git worktree工作流实战

2026年VSCode插件清单:AI编程与Git worktree工作流实战

1. 为什么2026年还要重新审视VSCode插件清单如果你是从2020年甚至更早就开始用VSCode的老用户,大概率会有一种错觉:插件这东西,装完一套就能用一辈子。我身边不少同事的插件列表还停留在"Prettier ESLint GitLens"三件套的时代&a…

2026/9/20 3:32:22 阅读更多 →
PCB版图寄生效应全解析:从原理到实战抑制技巧

PCB版图寄生效应全解析:从原理到实战抑制技巧

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/20 3:32:22 阅读更多 →
PT 种子下载插件怎么装?PT-Plugin-Plus 安装配置完整指南

PT 种子下载插件怎么装?PT-Plugin-Plus 安装配置完整指南

PT 种子下载插件怎么装?PT-Plugin-Plus 安装配置完整指南 【免费下载链接】PT-Plugin-Plus PT 助手 Plus,为 Microsoft Edge、Google Chrome、Firefox 浏览器插件(Web Extensions),主要用于辅助下载 PT 站的种子。 项…

2026/9/20 3:31:22 阅读更多 →

日新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/20 0:00:46 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/20 0:00:46 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/20 0:00:46 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/20 0:00:46 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/20 0:00:46 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/20 0:00:46 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/19 23:01:36 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/19 17:50:38 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/19 23:35:34 阅读更多 →