很多人第一次把图片发给 DeepSeek 时都会遇到类似的情况图片明明已经上传模型却无法直接理解画面只能提示“解析失败”或者把请求转交给单独的识图能力。原因并不复杂我们日常调用的 DeepSeek 主聊天模型本质上仍以文本输入和文本推理为主。它擅长分析、归纳、写作和复杂推理但图片里的物体、场景、表格与文字并不会自动变成它能理解的上下文。图 1主聊天模型无法直接解析图片需要额外的视觉识别链路。在我们自建的企业 AI 中台里我们没有简单地把文本模型替换掉而是为当前接入的 DeepSeek Flash 0731 增加了一条“视觉前置链路”先由 OCR 与通用视觉模型读取图片再把识别结果组织成结构化上下文交给 DeepSeek 完成后续推理。最终效果是员工仍然使用熟悉的 DeepSeek 对话入口却可以直接上传截图、照片、扫描件和文档页面让系统完成识别、理解和分析。先把事实说清楚这不是把文本模型硬改成视觉模型根据 DeepSeek 官方 Chat Completions 文档主聊天接口中的用户消息内容仍以文本结构为主。因此把图片直接按多模态消息格式发送给不支持该格式的模型通常会出现参数反序列化失败、未知image_url类型或者模型完全看不到图片内容。DeepSeek 也开源过独立的视觉语言模型系列例如 DeepSeek-VL2。它与主聊天文本模型属于不同的模型家族和部署链路并不意味着所有 DeepSeek API 模型天然都具备图像输入能力。我们这次实现的准确描述是保留 DeepSeek Flash 0731 的文本推理能力通过企业 AI 中台增加 OCR、视觉理解、上下文编排与失败降级让它获得“系统级多模态”体验。换句话说不是给基础模型重新训练出一双眼睛而是让中台先“看懂”再让 DeepSeek 负责“想明白、讲清楚”。整体架构视觉模型负责看DeepSeek 负责想这条链路可以概括为图片 / 截图 / 扫描件 / PDF 页面 ↓ 文件校验与图像预处理 ↓ OCR 通用视觉模型 ↓ 结构化视觉上下文与置信度 ↓ DeepSeek Flash 0731 ↓ 中文回答 / 表格 / 报告 / Agent 动作图 2视觉模型先完成图片内容识别再把结构化结果交给 DeepSeek 分析。这套设计中有一个非常重要的细节OCR 不等于视觉理解。OCR 擅长读取发票、合同、截图、表格和扫描件中的文字但面对“一只狗正在吃西瓜”这样的自然图片单靠 OCR 只能得到“未提取到文字”。所以我们把 OCR 和通用视觉模型组合起来有文字的图片优先提取原文、坐标、表格和版面结构没有文字的图片识别主体、场景、动作、颜色和空间关系混合内容合并 OCR 结果与视觉描述并保留来源与置信度识别失败时不把空结果伪装成成功而是提示用户切换模型或重新上传。核心实现步骤1. 输入路由先判断请求里有没有视觉内容中台收到消息后先检查附件类型。纯文本请求直接交给 DeepSeek图片、截图或 PDF 页面则进入视觉解析流程。这样不会让普通对话承担额外的视觉推理成本。2. 文件安全与预处理企业场景不能把“能上传”当作“可直接处理”。进入模型前我们会执行文件类型、大小与扩展名校验图片解码与异常文件拦截超大图片缩放、方向纠正与必要的清晰度增强PDF 页面转换与页码关联临时文件隔离、访问控制与生命周期清理。3. OCR 与视觉模型协同识别对办公文档OCR 输出文本、段落、表格和位置关系对自然图片视觉模型输出主体、动作、环境与关键细节。中台把两路结果合并成稳定的数据结构而不是把一大段未经整理的描述直接塞给大模型。示意结构如下{summary:一只白色小型犬在草地野餐垫上抱着西瓜,objects:[白色小型犬,西瓜,野餐垫,草地],actions:[双爪托住西瓜,张嘴进食],ocr_text:[],confidence:0.94,source:vision-service}4. 给 DeepSeek 构造可追溯的上下文视觉结果会和用户原始问题一起组成一段明确的系统上下文。DeepSeek 负责基于这些已识别的信息完成解释、比较、总结、表格整理或后续 Agent 决策。简化后的伪代码如下defhandle_message(user_text:str,images:list[bytes]):ifnotimages:returndeepseek.chat(user_text)visual_contextvision_service.analyze(images)promptf 你是企业 AI 助手。请仅依据下面的视觉识别结果和用户问题回答 不确定的信息必须明确说明不得凭空补全。 视觉识别结果{visual_context}用户问题{user_text}returndeepseek.chat(prompt)5. 失败降级与可观测性视觉服务超时、图片损坏或模型不可用时中台不会继续向 DeepSeek 发送一个空的“识别成功”结果而是进入明确的降级流程重试可恢复的网络错误切换备用 OCR 或视觉模型对用户给出中文错误提示与下一步建议记录请求链路、耗时和错误类型但不在日志中保存敏感原图保留模型调用与结果来源便于企业审计。为什么不直接把所有请求都交给一个大多模态模型在企业中台里模型能力不是越“大而全”越好关键是可控、可替换和可审计。采用“视觉识别 DeepSeek 推理”的组合有几个现实优势保留强文本推理能力复杂总结、结构化输出和业务分析继续由熟悉的 DeepSeek 完成。能力解耦OCR、通用视觉和文本模型可以独立升级不必绑定单一厂商。成本可控纯文本请求不触发视觉模型只有包含图片的消息才走视觉链路。便于治理企业可以分别控制文件权限、视觉模型、文本模型和审计日志。失败可降级某个视觉服务异常时可以替换后端而不是让整个聊天入口不可用。实际体验员工仍然只需要一个对话框对最终用户而言复杂的路由与模型协作都藏在中台后面。员工只需要上传图片并提出问题例如“请描述这张现场照片里的异常情况”“识别这张表格截图并整理成 Markdown”“读取合同扫描页提取甲乙方与关键日期”“分析设备告警截图给出排障建议”“把白板照片整理成会议纪要和待办事项”。图 3用户仍然在统一的企业 AI 对话入口中使用 DeepSeek视觉能力由中台自动编排。仍然需要明确的能力边界这套方案带来的是系统级多模态能力但不能因此忽略边界视觉模型可能识别错误关键业务字段需要人工复核OCR 对模糊、倾斜、手写或复杂表格的准确率会下降图片中的文字同样可能包含提示注入不能直接获得系统指令权限视频不是“多传几张图片”还需要抽帧、时序理解与语音转写涉及合同、身份信息和内部截图时必须遵守企业数据权限和留存策略模型输出只能作为辅助结论不能替代法务、财务、安全等专业审核。企业 AI 中台的价值不是把越来越多模型堆进一个下拉框而是让不同模型在正确的位置协作。DeepSeek Flash 0731 继续发挥它擅长的文本推理OCR 和视觉模型补上“看见”的能力中台则负责路由、编排、权限、审计与降级。这样我们不需要等待某一个模型原生包办所有事情也能让企业员工获得自然、统一、可治理的多模态体验。模型未必原生全能但中台可以让能力真正组合起来。