BentoML 流式响应实战:LLM 文本流、音频字节流与服务端流式实现解析
模型推理服务人工智能后端大模型MLOpsLLMOps【免费下载链接】BentoMLThe easiest way to serve AI apps and models - Build Model Inference APIs, Job queues, LLM apps, Multi-model pipelines, and more!项目地址https://gitcode.com/gh_mirrors/be/BentoML点击查看免费下载本文基于 BentoML 官方文档 Stream responses 展开讲解如何用 Python 生成器Generator / AsyncGenerator在bentoml.api中实现 LLM 文本的流式输出以及如何通过挂载 FastAPI 的 WebSocket 端点实现 TTS 音频字节流。读完本文你将掌握流式接口在 BentoML 中的声明方式与自动识别机制、响应底层如何被包装为StreamingResponse、客户端如何消费流式数据以及 WebSocket 音频流的完整落地路径。为什么需要流式响应流式Streaming让你把大块或增量数据分片chunk发送给客户端而不必等整个结果生成完毕再一次性返回从而显著改善实时用户体验。BentoML 对两类典型场景提供了原生支持大语言模型LLM输出用户希望边生成边显示而不是等待完整回答音频合成TTS等实时数据语音助手、实时音频处理需要把音频字节持续推送给客户端。从源码结构看BentoML 的流式能力分为两条技术路线普通推理 API 走生成器返回值 StreamingResponse的 HTTP 流式协议而需要双工、长连接的场景如音频则走挂载 ASGI 应用 WebSocket路线。流式输出 LLM用 async generator 声明接口BentoML 中流式接口的核心约定非常简洁只要bentoml.api修饰的方法是一个生成器函数同步yield或异步生成器函数async ... yield服务端就会自动将其按流式响应处理。下面是一个基于 OpenAI API 的完整示例继承自原文档import bentoml from typing import Literal, Generator from pydantic import BaseModel # Define message structure for LLM input class Message(BaseModel): content: str role: Literal[assistant, user, system] bentoml.service class LLMExample: def __init__(self) - None: # Initialize your model configuration # A dummy example here self.model_id MODEL_ID bentoml.api async def generate(self, prompt: str) - Generator[str, None, None]: # Yields text chunks from the LLM response from openai import AsyncOpenAI # Initialize OpenAI client client AsyncOpenAI() message Message(roleuser, contentprompt) # Call OpenAIs chat completion API with streaming enabled completion await client.chat.completions.create( modelself.model_id, messages[message.model_dump()], # type: ignore streamTrue, ) # Stream and yield the response chunks async for chunk in completion: yield chunk.choices[0].delta.content or 要点说明generate是async def且包含yield即异步生成器每次yield出的字符串片段会被即时发送到客户端输入参数prompt: str会被 BentoML 的 IO 描述符系统解析为请求体字段流式输出Generator[str, None, None]决定响应以文本形式分块下发该写法对任意边生成边产出的后端都成立替换 OpenAI 为 vLLM 或其他推理引擎时接口形态不变BentoML 社区还有基于 vLLM 部署不同 LLM 的示例仓库 BentoVLLM 可参考。源码级机制流式接口是如何被识别的这一约定优于配置的行为可以在 SDK 源码中得到印证流式判定。在 src/_bentoml_sdk/method.py 中API 元数据有一个is_stream属性其默认值由函数类型自动推导is_stream.default def default_is_stream(self) - bool: return inspect.isasyncgenfunction(self.func) or inspect.isgeneratorfunction( self.func )即只要是异步生成器函数或普通生成器函数该 API 即被标记为流式无需任何额外装饰器参数。流式响应的 MIME 类型。同一文件中定义了默认流媒体类型并在 API 初始化时回填到输出规格DEFAULT_STREAM_MEDIA_TYPE text/event-stream # src/_bentoml_sdk/method.py#L29 ... def __attrs_post_init__(self) - None: if self.is_stream and not self.output_spec.media_type: self.output_spec.media_type DEFAULT_STREAM_MEDIA_TYPE这意味着流式 API 的响应头Content-Type默认是text/event-stream与主流前端/SDK 对 SSE 流的处理习惯兼容。响应包装。真正的生成器 → HTTP 流转换发生在 src/_bentoml_sdk/io_models.py 的IODescriptor.to_http_response中对异步生成器inspect.isasyncgen(obj)服务端会先await obj.__anext__()试探性地取第一个 chunk——如果生成器在首个yield之前就抛错例如初始化 OpenAI client 失败、鉴权失败错误可以在此阶段被捕获并体现在响应中而不是挂起为一个永远没有数据的流随后将后续 chunk 包装进 Starlette 的StreamingResponseasync def async_stream() - t.AsyncGenerator[str | bytes, None]: try: async for item in gen(): if isinstance(item, (str, bytes)): yield item else: obj_item (cls(item) if issubclass(cls, IORootModel) else item) for chunk in serde.serialize_model(...).data: yield chunk except Exception: logger.exception(Error while streaming response) return StreamingResponse(async_stream(), media_typecls.mime_type())对同步生成器inspect.isgenerator(obj)实现上先itertools.tee出一份试探流消费第一个元素以暴露早发错误再把原流交给content_stream()并同样以StreamingResponse返回每个 chunk 可以是str/bytes直接透传也可以是 Pydantic 模型实例经 serde 序列化后再分块下发流中途抛错会被记录日志Error while streaming response并终止该响应。客户端如何消费流式输出BentoML 内置 Python 客户端同样支持流式消费详见 Python 客户端文档 的 Streaming 一节同步客户端SyncHTTPClient流式 API 返回一个 Python generator随接收随产出with bentoml.SyncHTTPClient(base_urlhttp://localhost:3000) as client: for data_chunk in client.stream_data(): # 对应你的流式 API print(data_chunk, end, flushTrue)异步客户端AsyncHTTPClient返回 async generator可用async for迭代async with bentoml.AsyncHTTPClient(base_urlhttp://localhost:3000) as client: async for data_chunk in client.generate(prompt...): print(data_chunk, end, flushTrue)流式音频字节WebSocket FastAPI 挂载TTS、实时语音助手等场景需要双向、长连接的通信模型单纯 HTTP 流式响应不够通常要构建 WebSocket 服务器。BentoML 的做法是用 FastAPI 定义 WebSocket 端点再通过bentoml.asgi_app把 FastAPI 应用整体挂载到 BentoML Service 上完整原理见 ASGI 应用挂载文档 与 WebSocket 端点文档。原文档给出的示例如下import bentoml from fastapi import FastAPI, WebSocket from typing import Generator # Create a FastAPI app app FastAPI() bentoml.service bentoml.asgi_app(app) # Integrate FastAPI app with BentoML class TTSExample: def __init__(self) - None: # Initialize your TTS engine here self.engine self.setup_tts_engine() def setup_tts_engine(self): # Configure your TTS engine here pass def synthesize(self, text: str) - Generator[bytes, None, None]: # Implement your TTS logic here pass # Define a WebSocket endpoint for streaming audio app.websocket(/ws) async def speech(self, websocket: WebSocket): await websocket.accept() try: while True: # Receive text from client data await websocket.receive_text() # Stream audio chunks back to client for chunk in self.engine.synthesize(data): await websocket.send_bytes(chunk) except Exception as e: print(fError in WebSocket connection: {e}) finally: await websocket.close()结构与要点app FastAPI()在 Service 外部创建bentoml.asgi_app(app)负责将其挂到 Service 的 ASGI 层上。从源码看装饰器定义在 src/_bentoml_sdk/decorators.py最终调用 Service 的mount_asgi_app实现见 src/_bentoml_sdk/service/factory.py并把挂载应用的既有路由一并提取注册到 OpenAPI/路由表app.websocket(/ws)是 FastAPI 原生 WebSocket 路由路由函数定义在 Service 类内部因此可以直接用self.engine访问 TTS 引擎实例通信模式是客户端send文本 → 服务端调用self.engine.synthesize(data)得到一个同步生成器 → 循环send_bytes把音频 chunk 推回客户端连接断开时走finally关闭asgi_app支持path参数为挂载的 FastAPI 应用设置前缀。例如bentoml.asgi_app(app, path/chat)后上述端点的完整地址就是ws://localhost:3000/chat/ws前缀 路由名。由于 WebSocket 端点不属于普通 HTTP 推理 APIBentoML 的 Python 客户端尚不支持调用它需要自行实现客户端。使用websockets库的调用示例import asyncio import websockets async def test_websocket(): # /chat comes from the asgi_app path, /ws from the endpoint # Adjust URL as needed uri ws://localhost:3000/chat/ws async with websockets.connect(uri) as websocket: # Send a test message await websocket.send(Hello BentoML) response await websocket.recv() print(fResponse: {response}) # Run the test asyncio.run(test_websocket())另外bentoml.service的traffic{timeout: N}参数可调整请求超时对于长连接的 WebSocket 场景参照 WebSocket 文档 中的做法可以显式设置一个较大的超时值以避免连接被服务端超时策略提前切断。流式方案选型小结场景推荐方案关键机制LLM 文本逐词输出、大对象分块下载bentoml.api返回生成器 / async generator自动识别为流式 APIStreamingResponse下发默认text/event-streamTTS 音频推送、实时语音、双向通信FastAPIapp.websocketbentoml.asgi_app挂载ASGI 应用与 BentoML Service 并存于同一服务进程WebSocket 走双工长连接两条路线的共同前提是流式逻辑都写在 Service 内部或通过 ASGI 挂载应用访问 Service 实例从而共享模型的加载与生命周期管理。延伸阅读与验证路径服务端的流式识别与响应包装src/_bentoml_sdk/method.py、src/_bentoml_sdk/io_models.pyASGI 挂载装饰器与路由提取src/_bentoml_sdk/decorators.py、src/_bentoml_sdk/service/factory.py相关文档ASGI 应用挂载、WebSocket 端点、Python 客户端流式消费原文档还指向两个社区示例项目基于 vLLM 服务不同 LLM 的 BentoVLLM以及用开源模型构建语音 Agent 的 BentoVoiceAgent适合在掌握本文基础后进一步对照实践。赞分享模型推理服务人工智能后端大模型MLOpsLLMOps【免费下载链接】BentoMLThe easiest way to serve AI apps and models - Build Model Inference APIs, Job queues, LLM apps, Multi-model pipelines, and more!项目地址https://gitcode.com/gh_mirrors/be/BentoML点击查看免费下载相关推荐vLLM流式输出实现实时LLM响应技术细节vLLM流式输出实现实时LLM响应技术细节 引言LLM响应延迟的行业痛点 在大型语言模型LLM应用中用户体验与响应速度直接相关。传统的完整生成模式下人工智能大模型模型推理服务推理引擎本地部署从字节流到字素簇AIRI 流式文本动画与 Clustr 读取库实战解析从字节流到字素簇AIRI 流式文本动画与 Clustr 读取库实战解析 本文以 AIRI 项目 2025.08.01 DevLog 为基础展开当聊天消息、语AI 应用人工智能大模型数字人AI Agent语音前端后端桌面应用移动开发即时通讯3D渲染mistral.rs 服务端流式输出实战用 OpenAI Python 客户端实现逐 Token 流式对话mistral.rs 服务端流式输出实战用 OpenAI Python 客户端实现逐 Token 流式对话 导读 本文讲解 mistral.rs 以 Open推理引擎模型推理服务AI Agent多模态上一篇【亲测免费】 推荐开源项目FastAPI-Utils - 提升你的FastAPI开发效率下一篇【亲测免费】 探索微软开源的表格数据转换工具Table Transformer创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

Hugo Blox Builder 简历页实战:用 resume 系列 Blox 组装 Experience / Skills / Awards / Languages 履历页面

Hugo Blox Builder 简历页实战:用 resume 系列 Blox 组装 Experience / Skills / Awards / Languages 履历页面

静态站点前端开发工具 【免费下载链接】kit 🧱 Describe your site, AI builds it, you own it as Markdown. Snap together Tailwind blocks like Lego — landing pages, blogs, portfolios, docs & more. No AI slop. Free to deploy anywhere 👇…

2026/9/25 8:22:38 阅读更多 →
React.cache() 请求内去重指南:服务端认证与数据库查询的 RSC 性能优化(mediago Vercel React 最佳实践)

React.cache() 请求内去重指南:服务端认证与数据库查询的 RSC 性能优化(mediago Vercel React 最佳实践)

音视频桌面应用后端 【免费下载链接】mediago 跨平台视频提取工具:支持流媒体下载、视频下载、m3u8 下载及 B站视频下载,提供 Windows 和 Mac 桌面客户端。Cross-platform video extraction tool: Supports streaming download, video download, m3u8 do…

2026/9/25 8:21:38 阅读更多 →
DeepPCB标注格式深度解析:x1,y1,x2,y2,type与6大缺陷类别ID详解

DeepPCB标注格式深度解析:x1,y1,x2,y2,type与6大缺陷类别ID详解

DeepPCB标注格式深度解析:x1,y1,x2,y2,type与6大缺陷类别ID详解 【免费下载链接】DeepPCB A PCB defect dataset. 项目地址: https://gitcode.com/gh_mirrors/de/DeepPCB 想快速上手 DeepPCB 数据集吗?本文用最短篇幅讲透它的标注格式&#xff1a…

2026/9/25 8:21:38 阅读更多 →

最新新闻

OpenCode 与 OpenCLAW 的 AI 模型配置:用 TaoToken 统一 Key 打通多工具调用

OpenCode 与 OpenCLAW 的 AI 模型配置:用 TaoToken 统一 Key 打通多工具调用

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/25 13:13:40 阅读更多 →
ORACLE 经验两则:Sys_Refcursor 与外部表 SKIP 的配置骨架

ORACLE 经验两则:Sys_Refcursor 与外部表 SKIP 的配置骨架

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/25 13:13:40 阅读更多 →
Claude 在得物 App 数仓的深度集成与效能演进:TaoToken 统一 Key 通道配置实战

Claude 在得物 App 数仓的深度集成与效能演进:TaoToken 统一 Key 通道配置实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/25 13:13:40 阅读更多 →
WorkBuddy Enterprise 企业级 Agent 平台架构与 MCP 落地实践

WorkBuddy Enterprise 企业级 Agent 平台架构与 MCP 落地实践

1. 从「超级个体」到「超级团队」:这个平台到底在解决什么问题第一次看到「WorkBuddy Enterprise」这个名字,我脑子里蹦出来的第一个念头是:腾讯云终于把 CodeBuddy 那套东西往企业级方向推了。如果你最近半年一直在关注 Agent 开发这条线&am…

2026/9/25 13:13:40 阅读更多 →
Atlas 300V 24G实战:AI推理加速卡部署YOLO全流程

Atlas 300V 24G实战:AI推理加速卡部署YOLO全流程

很多人都为一个词搜过来:atlas。准确讲,搜到atlas又能和部署yolo扯上关系的,多半是盯上了华为Atlas 300V 24G这块卡。今天我不绕圈子,先说结论:Atlas 300V 24G确实是一块运算加速卡,但它更准确的定位&#…

2026/9/25 13:13:40 阅读更多 →
MySQL表空间传输:从原理到实战,把大表迁移从小时级压缩到分钟级

MySQL表空间传输:从原理到实战,把大表迁移从小时级压缩到分钟级

老规矩,先给结论:MySQL自带的表空间传输(Transportable Tablespace)功能,是处理“单表或一批表快速换实例”最好用的手段之一,尤其在数据量已经上到几十GB、几百GB,mysqldump导出导入慢到让人抓…

2026/9/25 13:12:40 阅读更多 →

日新闻

AI元人文:从工具使用到思维重构的深度探索

AI元人文:从工具使用到思维重构的深度探索

最近半年我一直在琢磨一件事:AI元人文到底是什么?说白了,就是“用元视角重新审视人与AI的关系”,也在“探索AI如何反向逼着我们发现自己的思考边界”。标题里的“元探索”,在我看就是一层套一层的追问——当你用AI解决…

2026/9/25 0:00:41 阅读更多 →
Python+CNN车牌识别实战:从数据预处理到模型训练与部署

Python+CNN车牌识别实战:从数据预处理到模型训练与部署

简介:基于Python与卷积神经网络的车牌识别项目,面向计算机视觉初学者及智能交通开发者,目标是帮助用户掌握从数据预处理、模型构建到实际部署的完整流程。压缩包共25个文件,包含jpg/png图像样本、py训练脚本、md说明文档、dat数据…

2026/9/25 0:00:41 阅读更多 →
Vim基础操作全攻略:保存退出、模式切换与高频命令实战

Vim基础操作全攻略:保存退出、模式切换与高频命令实战

1. 项目概述1.1 核心需求解析今天聊聊Vim。写这个题目的原因是:几乎每个后端开发者、运维人员、数据工程师某天都会遇到一个场景——深夜加班,服务器登录界面只有黑底白字,编辑器只有vi/vim,你必须在五分钟内完成一次配置修改并保…

2026/9/25 0:00:41 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/24 14:34:13 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/25 11:15:26 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/24 14:33:56 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/24 12:50:34 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/24 14:33:48 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/24 12:49:17 阅读更多 →