iPhone和Android也能推理Ornith-9B-Mobile端侧量化部署完整指南【免费下载链接】Ornith-1项目地址: https://gitcode.com/gh_mirrors/or/Ornith-1Ornith-9B-Mobile是 Ornith 模型家族中专为端侧推理打造的量化版本一颗约 9B 参数的稠密模型经过量化压缩后可直接在iPhone 和 Android手机上本地运行无需依赖云端 API。它和服务器版模型一样是推理型模型——会先输出思考过程再给出答案并原生支持 256K 长上下文是目前少见的能在手机上跑出 Agentic 编码能力的开源大模型。本文带你从零完成 Ornith-9B-Mobile 的端侧量化部署。为什么 9B-Mobile 能装进手机 端侧量化部署的本质是把模型权重从高精度浮点压缩成更紧凑的格式以换取更低的内存占用。Ornith 家族包含 9B 稠密版、35B 与 397B 的 MoE混合专家版本其中9B 稠密版单卡 80GB GPU 即可全精度运行也是量化到手机的理想底座9B-Mobile官方直接发布的量化构建定位就是iPhone / Android 端侧推理无需自己折腾量化脚本256K 上下文全系模型统一支持 262,144 token 的上下文窗口。各检查点的定位可以在 README.md 的 checkpoint 表格中查到MIT 协议、全球可访问授权条款见 LICENSE。部署前环境准备一步获取仓库先克隆仓库阅读官方说明权重文件请前往模型托管平台下载仓库本身只含文档git clone https://gitcode.com/gh_mirrors/or/Ornith-1端侧运行建议选用支持量化权重的轻量推理运行时如llama.cpp或Ollama——官方已为 Ornith 的 9B 与 35B 检查点发布了 GGUF 量化构建移动端同理用量化构建加载 9B-Mobile 即可。运行时的兼容要求与版本底线Transformers ≥ 5.8.1、vLLM ≥ 0.19.1 等记录在 README.md 的 Quickstart 章节。 提示手机内存紧张时优先选更低的量化档位速度优先则选高精度档位可按设备实际内存8GB / 12GB / 16GB逐级尝试。推理参数设置最快获得稳定输出的配置Ornith 是推理模型默认会先输出think思考块再作答端侧部署时推荐沿用官方采样参数参数推荐值说明temperature0.6日常使用top_p0.95日常使用top_k20日常使用temperature1.0复现基准成绩时使用官方完整参数说明见 README.md。如果想把思考过程和最终答案分开展示只需在think结束标记处切分输出文本README.md 给出了切分思路。端侧 9B 的实际能力边界9B 虽然能跑在手机上能力并不弱。Ornith-1.5-9B 在 README.md 公布的基准成绩中SWE-bench Verified 70.6修真实 GitHub issue 的能力超过不少更大模型SWE-bench Pro 47.5 / Multilingual 54.4多语言代码修复同样在线GPQA Diamond 86.4研究生级科学问答表现扎实BrowseComp 56.4网页信息检索类任务表现良好。 实际体验建议把端侧 9B-Mobile 当作离线可用的编码与推理助手——代码补全、脚本调试、文档问答都很合适超复杂的长链路 Agentic 任务则建议交给云端 35B / 397B。常见问题速查问手机发热、速度慢正常吗正常。9B 量化模型在手机 NPU/GPU 上推理本身就是高负载场景长上下文256K会进一步加剧日常使用建议限制生成长度。问能接工具调用Function Calling吗能。Ornith 原生输出标准工具调用块服务器端可解析为 OpenAI 风格的tool_calls端侧应用可自行解析同一格式用法示例见 README.md。问本地服务器部署和端侧部署怎么选单卡 80GB GPU 跑 bf16 版 9BvLLM / SGLang 一键起服务手机则用 9B-Mobile 量化版两者接口完全兼容方便做云端大模型 端侧小模型的混合架构。 至此你已在手机上拥有了一个能思考、能写代码的本地大模型。想深入了解训练思路与完整评测继续阅读仓库根目录的 README.md 即可。【免费下载链接】Ornith-1项目地址: https://gitcode.com/gh_mirrors/or/Ornith-1创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考