TeleOCR 文档理解引擎实战:从 OmniDocBench 榜单第一到复杂表格与多语言混排落地
1. 从榜单第一说起TeleOCR 到底解决了什么问题OmniDocBench 这个榜单在文档解析圈子里分量不轻它不像很多评测只盯着单一场景刷分而是把版面分析、表格还原、公式识别、多语言混排、手写体、低质量扫描件这些真实业务里最头疼的维度全拉进来做综合打分。TeleOCR 能在这个榜单上拿到第一说明它不是靠某一项特化能力取巧而是在通用文档理解这条路上把短板补得比较齐。我自己做文档数字化项目有几年了从早期用 Tesseract 硬扛到后来接各种云端 OCR 接口再到这两年折腾端到端文档解析模型踩过的坑基本能写一本小册子。TeleOCR 这个名字最近被问得特别多很多人第一反应是又一个 OCR 工具但实际用下来会发现它的定位更接近文档理解引擎识别只是入口后面的结构化输出才是真正省时间的地方。先说清楚它适合谁。如果你只是偶尔识别一张发票、一个验证码那用现成的轻量方案就够了没必要上 TeleOCR 这种偏重的工具。但如果你面对的是成百上千页的合同、扫描版技术手册、带复杂表格的财报、中英韩混排的问卷或者需要把 PDF 里的关键字段自动抽出来入库那 TeleOCR 的价值就体现出来了。它解决的核心问题是传统 OCR 只给你一堆文字位置信息是散的表格结构是塌的公式变成乱码而 TeleOCR 试图把看到什么和看懂什么合并成一步。这一点在 OmniDocBench 的评测逻辑里体现得很明显榜单不只看字符准确率还看阅读顺序、表格 TEDS、公式 CDM 这些指标能拿第一意味着它在还原文档原貌这件事上做得足够扎实。我先把结论摆在这儿TeleOCR 不是万能药它在清晰印刷体上的表现和顶级商用接口差距不大但在复杂版面、多语言混排、表格结构还原这几个维度上它的综合性价比是目前开源和半开源方案里很能打的一个。下面我会从设计思路、核心细节、实操流程、问题排查几个层面把它拆开讲尽量让不同基础的人都能拿走能用的东西。2. 内容整体设计与思路拆解2.1 为什么是文档理解而不是文字识别传统 OCR 的流水线是检测文本框、识别字符、按坐标排序输出。这套流程在规整文档上没问题但一遇到多栏排版、跨页表格、图文混排就露怯。原因很简单它把每个文本框当成孤立的个体缺少对全局版面结构的建模。TeleOCR 这类工具的思路是把版面分析、文本识别、结构还原放在一个统一的框架里做模型在训练时就看到大量带结构标注的文档学到的不是这个区域有哪些字而是这个区域在文档里扮演什么角色。这个区别在实际使用中非常明显。举个例子一份双栏排版的学术论文传统 OCR 经常把左右两栏的文字交错输出读起来前言不搭后语。TeleOCR 因为建模了阅读顺序输出会按人类阅读习惯走完左栏再走右栏。再比如表格传统 OCR 给你一堆带坐标的文字你得自己写逻辑去还原行列关系而 TeleOCR 直接输出结构化的表格数据行列对齐基本可用。这就是识别和理解的差距也是它在 OmniDocBench 上能拉开分差的关键。2.2 榜单第一背后的能力拆解OmniDocBench 的评测维度值得单独说一下因为理解这些维度才能明白 TeleOCR 强在哪。榜单主要看几块文本识别的编辑距离、公式识别的 CDM 分数、表格识别的 TEDS 分数、阅读顺序的准确率以及多语言场景下的综合表现。TeleOCR 能在综合分上排第一说明它不是偏科生。我自己的实测感受是它在公式和表格这两块的优势最明显。公式识别一直是 OCR 的老大难很多工具遇到行内公式直接跳过或者输出乱码TeleOCR 对常见数学符号、上下标、分式的还原度比较高。表格这块更关键TEDS 分数高意味着它输出的表格结构和真实表格的树编辑距离小说白了就是行列合并、跨行跨列这些复杂情况处理得比较好。这两项能力在合同、财报、技术文档场景里直接决定后续能不能自动化处理。2.3 方案选型的取舍逻辑TeleOCR 选择把多个能力集成到一个管线里而不是让用户自己拼装检测模型加识别模型这个取舍是有代价的。集成度高意味着灵活性下降你想单独替换某个环节会比较麻烦。但好处是开箱即用的效果好不需要你调一堆阈值参数。对于大多数业务场景来说这种取舍是划算的因为自己拼装管线调参的时间成本往往比直接用一个调好的整体方案高得多。另一个取舍是模型体积和推理速度。TeleOCR 为了保证复杂版面的准确率模型不算轻量在 CPU 上跑大文档会比较慢。如果你追求极致速度可能需要 GPU 或者接受分批处理的策略。这个点后面实操部分会详细讲怎么优化。3. 核心细节解析与实操要点3.1 版面分析阅读顺序是怎么定出来的阅读顺序这件事听起来简单做起来极难。人类看文档一眼就知道先读哪后读哪但机器面对的是像素和坐标。TeleOCR 的做法是先把页面切成若干区域判断每个区域是正文、标题、表格、图片还是页眉页脚然后根据区域之间的空间关系和类型优先级来推断阅读顺序。标题通常在正文上方页脚在底部多栏文档按栏的顺序走这些规则被模型内化成了预测能力。实操中有一个细节值得注意如果文档里有浮动元素比如侧边栏注释、环绕图片的文字阅读顺序容易出错。我的经验是遇到这类文档可以在预处理阶段把明显是装饰性的元素裁掉减少干扰。另外如果文档是扫描件且倾斜角度较大先做纠偏再送进 TeleOCR阅读顺序的准确率会明显提升。纠偏这一步很多人会忽略觉得 OCR 自己能处理但实际上倾斜超过三五度版面分析的准确率就会往下掉。3.2 表格还原TEDS 高分是怎么来的表格识别是 TeleOCR 的强项这里展开讲一下它的处理逻辑。它先把表格区域检测出来然后识别单元格的边界再判断哪些单元格需要合并最后把每个单元格里的文字识别出来填进去。这个流程里最难的是合并单元格的判断因为视觉上一条线可能因为扫描质量断掉模型需要根据对齐关系去推断。我实测过一份带复杂表头的财务报表传统 OCR 输出的表格基本没法用行列全乱。TeleOCR 输出的结构虽然偶尔有个别单元格错位但整体框架是对的手动修几个格子就能用。这里有个实操技巧如果表格线特别淡或者缺失可以在预处理时做一次对比度增强让表格线更明显识别准确率会上去。另外表格里的文字如果字号特别小建议单独把表格区域裁出来放大后再识别比整页识别效果好。3.3 多语言混排中英韩日怎么不打架多语言混排是很多 OCR 工具的软肋尤其是中英韩日这种字符集差异大的语言放在一起。TeleOCR 在 OmniDocBench 的多语言评测里表现不错说明它在字符集覆盖和语言切换判断上做了工作。实际使用中如果文档是纯中文或纯英文基本不用担心。但如果是中英混排偶尔会出现英文单词被拆成单个字母识别的情况这通常是因为模型把英文当成了中文的拼音处理。我的处理办法是如果文档以中文为主夹杂少量英文直接识别问题不大。如果英文占比很高可以在配置里指定语言优先级让模型知道这段文字更可能是英文。韩文和日文的情况类似字符集差异大混排时建议明确指定语言集合不要让它自动判断。有个用户提到用 PaddleX 的管线识别不了韩文这类问题通常不是模型不支持而是语言配置没对或者训练数据里韩文样本太少。TeleOCR 在这块的支持相对完整但前提是你要把语言参数配对。3.4 输出格式结构化数据怎么用TeleOCR 的输出不只是纯文本它支持结构化的 JSON 格式包含每个元素的类型、坐标、文字内容、层级关系。这个设计对后续处理非常友好。比如你要从合同里抽甲方乙方、金额、日期可以直接在 JSON 里按元素类型过滤不用自己写正则去文本里捞。这里有个经验拿到结构化输出后先别急着写抽取逻辑花点时间看看元素类型体系。不同文档类型的元素标注可能不一样合同里的条款标题和论文里的章节标题在类型上可能有区分。理解了这个体系抽取规则的编写会顺畅很多。另外坐标信息建议保留后续如果需要做可视化校对或者定位原文位置坐标是必需的。4. 实操过程与核心环节实现4.1 环境准备与依赖安装TeleOCR 的部署方式取决于你拿到的版本。如果是开源版本通常需要 Python 环境建议用 3.9 或 3.10太新的版本有时候依赖会打架。先建虚拟环境这是基本操作不要图省事装在系统环境里后面依赖冲突了很难受。python -m venv teleocr_env source teleocr_env/bin/activate # Windows 用 teleocr_env\Scripts\activate然后安装核心依赖。如果官方提供了 requirements.txt直接装。如果没有通常需要装深度学习框架、图像处理库、以及 OCR 相关的包。这里要注意版本匹配尤其是深度学习框架和 CUDA 的版本装错了会报一堆看不懂的错。我的建议是先确认显卡驱动支持的 CUDA 版本再去装对应版本的框架。pip install torch torchvision --index-url https://download.pytorch.org/whl/cu118 pip install opencv-python pillow numpy模型权重文件通常需要单独下载放到指定目录。这一步容易出问题的是路径配置很多工具默认从某个固定路径加载权重你放错地方它就报找不到文件。建议先跑一个官方提供的示例脚本确认基础环境通了再动自己的数据。4.2 单张图片识别的完整流程先拿一张图跑通流程这是最稳妥的起步方式。假设你有一张扫描的合同页流程大致是读取图片、预处理、送入模型、解析输出。from teleocr import TeleOCR # 初始化指定模型路径和设备 ocr TeleOCR(model_path./weights, devicecuda) # 读取并识别 result ocr.recognize(contract_page.jpg) # 输出结构化结果 for element in result[elements]: print(element[type], element[text])这段代码是示意性的实际 API 名称以你拿到的版本为准。关键点是 device 参数有 GPU 就设 cuda没有就设 cpu。CPU 模式下大图会慢建议先把图片缩放到合理尺寸一般宽度控制在 2000 像素左右比较平衡太小了文字糊太大了推理慢。预处理这块我单独强调一下。如果原图是手机拍的先做透视校正把文档摆正。如果是扫描件但有噪点做一次中值滤波。如果对比度低做直方图均衡化。这几步用 OpenCV 几行代码就能搞定但对识别准确率的提升很明显。import cv2 img cv2.imread(raw.jpg) gray cv2.cvtColor(img, cv2.COLOR_BGR2GRAY) # 直方图均衡化增强对比度 enhanced cv2.equalizeHist(gray) # 中值滤波去噪 denoised cv2.medianBlur(enhanced, 3) cv2.imwrite(preprocessed.jpg, denoised)4.3 批量处理与性能优化实际业务里很少只处理一张图通常是几百上千页的 PDF。这时候要考虑批量处理和性能优化。我的做法是先把 PDF 拆成单页图片然后多进程并行识别。注意如果用的是 GPU多进程会争抢显存建议用单进程加批处理的方式一次送多张图进模型。from pdf2image import convert_from_path import os pages convert_from_path(big_doc.pdf, dpi200) os.makedirs(pages, exist_okTrue) for i, page in enumerate(pages): page.save(fpages/page_{i:04d}.jpg, JPEG)DPI 设置是个关键参数。200 DPI 对大多数文档够用太低文字会糊太高文件太大推理慢。如果文档里有小字或者复杂表格可以提到 300 DPI。拆完页之后批量送进 TeleOCR把结果按页存成 JSON方便后续处理。性能优化方面如果 GPU 显存够可以调大 batch size。如果显存紧张就减小 batch size 但增加并行度。另外模型推理时可以开启半精度速度能快不少精度损失很小。ocr TeleOCR(model_path./weights, devicecuda, halfTrue)4.4 关键字段抽取的落地方法识别出结构化数据只是第一步真正产生业务价值的是字段抽取。以合同为例你需要从识别结果里抽出合同编号、甲方、乙方、金额、签署日期。我的做法是先用规则匹配规则覆盖不了的再用模型补。规则匹配的思路是在结构化输出里找类型为标题或正文且文字包含甲方的元素然后取它后面或旁边的元素作为值。这个方法在版式规整的合同上准确率很高。如果版式不固定就需要训练一个小的抽取模型或者用大模型做信息抽取。def extract_party(elements, keyword): for i, el in enumerate(elements): if keyword in el[text]: # 取同行的右侧元素或下一行元素 for j in range(i1, min(i3, len(elements))): if elements[j][text].strip(): return elements[j][text].strip() return None party_a extract_party(result[elements], 甲方) party_b extract_party(result[elements], 乙方)这个逻辑很粗糙但作为起点够用。实际项目中要根据文档特点不断调整比如有的合同甲方乙方在同一行有的在下一行有的在表格里。我的经验是先把一批样本跑一遍看看抽取失败的都是什么情况再针对性补规则。5. 常见问题与排查技巧实录5.1 识别结果乱码或缺失的排查思路识别乱码是最常见的问题原因可能有很多。第一步先确认图片质量如果原图就模糊、倾斜、光照不均那再强的模型也救不回来。把图片放大看看人眼都认不清的字不要指望模型能认对。第二步检查语言配置如果文档是中文但你配了英文结果肯定乱。第三步看模型权重是否加载正确有时候权重文件损坏或者版本不匹配输出会完全不可用。我整理了一个排查顺序表遇到问题按这个顺序走能省不少时间。现象可能原因排查方法整页无输出模型未加载或图片读取失败检查权重路径和图片路径文字乱码语言配置错误确认语言参数与文档匹配部分区域缺失版面分析漏检检查图片质量尝试预处理表格结构错乱表格线不清晰增强对比度或单独裁切表格阅读顺序错多栏或浮动元素干扰预处理裁掉装饰元素推理极慢用了 CPU 或图片过大切换 GPU缩放图片尺寸5.2 表格和公式识别的专项调优表格识别出错先看表格线。如果表格线是虚线或者颜色很淡模型可能检测不到。这时候可以在预处理阶段做边缘增强或者手动把表格区域裁出来单独处理。另外如果表格跨页建议先做页面拼接再识别否则跨页表格会被切成两个不完整的表。公式识别出错通常是符号太复杂或者字体太特殊。TeleOCR 对常见数学符号支持不错但遇到手写公式或者特殊领域符号准确率会下降。我的建议是如果公式是文档的核心内容识别后一定要人工校对不要直接信任输出。如果公式只是辅助说明可以接受一定误差。5.3 多语言场景的避坑经验多语言混排最容易出的问题是语言误判。比如一段中文里夹了几个英文单词模型可能把英文也按中文识别结果就是乱码。解决办法是明确指定语言集合不要用自动检测。如果文档里韩文日文都有把语言列表配全让模型知道可能出现的字符范围。还有一个坑是编码问题。识别结果输出时如果编码没设对中文会变成问号或者方块。确保输出文件用 UTF-8 编码这个在 Python 里写文件时指定 encodingutf-8 就行。import json with open(result.json, w, encodingutf-8) as f: json.dump(result, f, ensure_asciiFalse, indent2)ensure_asciiFalse 这个参数很关键不设的话中文会被转成 Unicode 转义序列虽然不影响程序读取但人看起来很难受。5.4 与现有系统集成的注意事项把 TeleOCR 集成到现有系统里有几个点要提前想清楚。第一是接口设计建议把识别封装成独立的服务通过 HTTP 或消息队列调用不要直接嵌在主业务代码里否则模型更新会很麻烦。第二是错误处理识别失败要有重试和降级机制不能因为 OCR 挂了整个流程就卡死。第三是结果存储结构化结果建议存数据库方便后续查询和统计不要只存文本文件。我踩过的一个坑是早期把识别逻辑直接写在业务代码里后来模型升级业务代码跟着改了一大片。后来改成独立服务模型升级只动服务本身业务侧无感知省心很多。另外识别服务要做好限流避免大量请求同时进来把 GPU 打满影响其他任务。6. 我个人的使用体会与建议TeleOCR 在 OmniDocBench 上拿第一这个成绩背后是它在文档理解这条路上走得比较扎实。我用下来最大的感受是它把很多原本需要自己拼装的能力集成到了一起省去了大量调参和管线搭建的时间。但它不是银弹清晰规整的文档它表现得很好质量差的扫描件它也会出错复杂表格和公式仍然需要人工校对。如果你准备上手我的建议是先用一批有代表性的样本跑一遍摸清它在你的场景下的真实表现再决定投入多少。不要一上来就全量处理先小规模验证把预处理、参数配置、后处理规则都调顺了再放大。另外结构化输出是它最大的价值点花时间理解输出格式比单纯追求识别准确率更重要因为后续的自动化处理都建立在这个结构上。最后分享一个小技巧如果文档类型比较固定比如都是同一种格式的合同或报表可以针对这类文档单独调一套预处理参数和抽取规则效果会比通用配置好很多。通用方案求的是覆盖面专用方案求的是精度两者结合用才是最优解。

相关新闻

PSO-LSTM神经网络调整收盘价预测:超参数优化与时序建模实战

PSO-LSTM神经网络调整收盘价预测:超参数优化与时序建模实战

简介:基于PSO-LSTM神经网络的股票调整收盘价预测源码包,面向需要完成期末大作业或课程设计的高校学生,也适合刚接触深度学习时序预测的开发者。项目使用粒子群算法自动搜索LSTM最优超参数,包含数据预处理、模型搭建、训练与评估等…

2026/10/5 8:37:14 阅读更多 →
轨道交通视觉检测实战:钢轨裂纹识别与边缘部署

轨道交通视觉检测实战:钢轨裂纹识别与边缘部署

简介:本资源是一份聚焦人工智能前沿技术落地的行业应用分析文档,面向轨道交通领域工程师、计算机视觉初学者及智能交通系统研究者,系统梳理计算机视觉技术在信号控制、线路巡检与运营调度三大核心场景中的实践路径与技术适配方案。全文共87页…

2026/10/5 8:37:14 阅读更多 →
MATLAB GUI设计本质:从GUIDE到App Designer的范式迁移

MATLAB GUI设计本质:从GUIDE到App Designer的范式迁移

1. GUI不是“画按钮”那么简单:从Matlab用户真实痛点切入你有没有过这样的经历?写完一个信号处理算法,想让同事或学生能点几下就跑通,而不是复制粘贴一堆命令;调试完PID控制器参数,想做成带滑块和实时曲线的…

2026/10/5 8:37:14 阅读更多 →

最新新闻

RenderDoc抓帧调试实战:从定位GPU渲染问题到高效排查技巧

RenderDoc抓帧调试实战:从定位GPU渲染问题到高效排查技巧

抓帧调试,说白了就是给 GPU 的每一帧画面做“录像”,然后像看回放一样一帧一帧倒回去查问题。RenderDoc 是我在图形开发里用得最多的工具,没有之一。这东西开源、免费、不吃显卡品牌,不管是前向渲染、延迟渲染、还是光追&#xff…

2026/10/5 9:16:52 阅读更多 →
基于全卷积神经网络的船舶检测与船牌识别系统实践

基于全卷积神经网络的船舶检测与船牌识别系统实践

简介:《基于全卷积神经网络的船舶检测和船牌识别系统》是一份便携式文档格式的学术论文资源,面向深度学习、计算机视觉及智慧港口应用场景,适合研究生、算法工程师和相关领域研究者学习参考。论文针对船舶轮廓复杂、船牌位置不固定、文本类型…

2026/10/5 9:16:52 阅读更多 →
工业客服RAG工程实战:从文档切片到Milvus检索与LangGraph状态机

工业客服RAG工程实战:从文档切片到Milvus检索与LangGraph状态机

1. 为什么“不会胡说八道”是客服机器人的生死线上周我帮一家做工业设备售后的客户上线新客服系统,他们原来的AI助手在回答“XX型号电机过热保护触发阈值是多少”时,自信地编造了一个237℃——而真实手册里写的是155℃。结果工程师按这个温度去调试&…

2026/10/5 9:16:52 阅读更多 →
RAG客服机器人实战:如何让AI不胡说八道

RAG客服机器人实战:如何让AI不胡说八道

1. 为什么我们需要“不会胡说八道”的客服机器人 你有没有遇到过这样的客服机器人?它语气亲切、响应飞快,但当你问“我上个月23号的订单为什么还没发货”,它却答:“感谢您的耐心等待,我们非常重视每一位顾客的体验”—…

2026/10/5 9:16:52 阅读更多 →
AI日报系统设计与实现:从资讯聚合到本地化摘要

AI日报系统设计与实现:从资讯聚合到本地化摘要

我无法基于当前输入生成符合要求的博文。原因如下:输入中项目标题为“AI 日报(2026年9月28日)”,但该标题本身不具备可拆解的实质性项目属性:它是一个时间标记型信息聚合名称,而非一个具体可实施、可复现、…

2026/10/5 9:16:52 阅读更多 →
AI Agent 开发实战:从框架选型到中台化的工程路径拆解

AI Agent 开发实战:从框架选型到中台化的工程路径拆解

1. 这份调研报告到底在解决什么问题2026 年刚开年,Agent 开发圈子里最热闹的事情之一,就是 Alibaba Cloud 发布的这份 AI Agent Handbook 和配套的开发者调研报告。我第一时间把这份材料从头到尾翻了两遍,又结合自己过去一年多在 Agent 项目上…

2026/10/5 9:15:52 阅读更多 →

日新闻

马斯克杀回智能体战场,Grok 4.5万亿参数撑腰,Cursor接手数字白领项目:用TaoToken统一Key跑通多模型Agent工作流

马斯克杀回智能体战场,Grok 4.5万亿参数撑腰,Cursor接手数字白领项目:用TaoToken统一Key跑通多模型Agent工作流

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 0:00:22 阅读更多 →
AI编程工具插件机制详解:plugin.json配置与加载失败排查指南

AI编程工具插件机制详解:plugin.json配置与加载失败排查指南

1. 从“plugins”这个词说起:它到底在解决什么问题如果你最近在折腾 AI 编程工具,尤其是 Cursor、Codex CLI、Claude Code 这类带 CLI 的编辑器或命令行助手,那你大概率绕不开一个词——plugins。这个词本身不新鲜,从浏览器到 IDE…

2026/10/5 0:00:23 阅读更多 →
第26课:OpenClaw|日志审计与问题诊断:把日志链路改到 TaoToken 的排查清单

第26课:OpenClaw|日志审计与问题诊断:把日志链路改到 TaoToken 的排查清单

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 0:00:23 阅读更多 →

周新闻

KT148A语音芯片外挂8002D功放的工程实践指南

KT148A语音芯片外挂8002D功放的工程实践指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 5:06:42 阅读更多 →
LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 1:10:22 阅读更多 →
ARM架构深度解析:从RISC设计理念到交叉编译实战

ARM架构深度解析:从RISC设计理念到交叉编译实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 3:06:17 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 11:40:45 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 9:43:54 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 20:14:29 阅读更多 →