屏幕文字识别完全指南:4种主流方案对比 + API接入实战(附Python/Java/JS/PHP示例)
屏幕文字识别完全指南4种主流方案对比 API接入实战附Python/Java/JS/PHP示例一、什么是屏幕文字识别屏幕文字识别Screen OCR是一种通过图像处理与OCR光学字符识别技术将屏幕显示的非结构化文字信息转化为可编辑、可搜索的电子文本的技术。简单来说就是截图 → 识别 → 得到文字。三大核心应用场景场景典型需求传统痛点游戏辅助识别任务名称、物品价格、角色等级固定坐标找图版本更新即失效办公自动化提取软件界面文字、报表数据人工复制粘贴效率极低RPA流程自动化自动识别网页/APP中的文字信息无法动态响应维护成本高二、4种主流屏幕文字识别方案对比目前实现屏幕文字识别主要有以下四种方案方案类型代表工具/引擎优点缺点适用场景本地开源OCRTesseract、PaddleOCR、EasyOCR免费、可离线、数据安全识别率相对较低、环境配置复杂、中文支持参差不齐内网环境、隐私敏感场景云端OCR API商业OCR API服务识别准确率高99%、支持多语言、无需部署、开箱即用需联网、按调用量付费生产环境、对准确率要求高的场景自动化脚本工具懒人精灵、按键精灵、EasyClick免Root免越狱、脚本化集成、支持移动端依赖工具生态、需学习特定脚本语言手游脚本、移动端自动化Python截图识别PyAutoGUI PaddleOCR/Tesseract灵活可控、可定制、生态丰富需编程基础、环境搭建有一定门槛桌面端自动化、批量处理选型建议追求最高识别准确率和最快接入速度→ 选择云端OCR API要求数据不出内网、完全离线→ 选择本地开源OCR做手游脚本、移动端自动化→ 选择懒人精灵/按键精灵等脚本工具做桌面端自动化、批量处理→ 选择Python OCR库三、准备工作无论选择哪种方案接入云端OCR API都需要以下准备工作注册OCR API账号获取API Key注册即送免费测试积分准备一张屏幕截图可用系统截图工具或代码自动截图选择开发语言Python/Java/JavaScript/PHP均可石榴智能OCR API接入免费在线体验支持免费在线体验API文档API文档清晰提供多种接入语言示例如python、js、C#、java、php等以及自动化脚本语言如天诺、懒人精灵、按键精灵、易语言、EasyClick、触动精灵等注册送免费测试积分四、方案一云端OCR API接入实战推荐以下代码以调用通用文字识别OCR API为例替换YOUR_API_KEY和YOUR_SECRET_KEY为你的真实凭证即可运行。4.1 Python接入含自动截图# # 免费在线体验https://market.shiliuai.com/tools/ocr/general-text # API文档完整开发文档和代码示例https://market.shiliuai.com/doc/advanced-general-ocr # 支持免费在线体验 # API文档清晰提供多种接入语言示例如python、js、C#、java、php等以及自动化脚本语言如天诺、懒人精灵、按键精灵、易语言、EasyClick、触动精灵等 # # ----- 配置信息 ----- # 从石榴智能API市场获取API_KEY或SECRET_KEYhttps://market.shiliuai.com/ # import requests import base64 import json from PIL import ImageGrab # 需安装pip install Pillow # 配置 API_URL http(s)://ocr-api.shiliuai.com/api/advanced_general_ocr/v1 API_KEY YOUR_API_KEY SECRET_KEY YOUR_SECRET_KEY # def screenshot_and_recognize(xNone, yNone, x1None, y1None): 截取屏幕区域并识别文字 :param x,y,x1,y1: 截图区域坐标左上角x,y右下角x1,y1不传则全屏 :return: 识别出的文字 # 步骤1截图 if x is not None and y is not None and x1 is not None and y1 is not None: img ImageGrab.grab(bbox(x, y, x1, y1)) else: img ImageGrab.grab() # 全屏截图 img.save(screenshot.png) print(✅ 截图成功) # 步骤2图片转Base64 with open(screenshot.png, rb) as f: image_base64 base64.b64encode(f.read()).decode(utf-8) # 步骤3调用OCR API headers { Content-Type: application/json, X-API-Key: API_KEY, X-Secret-Key: SECRET_KEY } payload {image: image_base64} response requests.post(API_URL, headersheaders, jsonpayload, timeout30) result response.json() # 步骤4解析结果 if result.get(code) 0: data result.get(data, {}) text data.get(text, ) print(f✅ 识别结果{text}) return text else: print(f❌ 识别失败{result.get(message)}) return None # 调用示例截取屏幕区域(100,100)到(800,500)并识别 if __name__ __main__: # 全屏识别 # result screenshot_and_recognize() # 区域识别 result screenshot_and_recognize(100, 100, 800, 500)4.2 Java接入代码// // 免费在线体验https://market.shiliuai.com/tools/ocr/general-text // API文档完整开发文档和代码示例https://market.shiliuai.com/doc/advanced-general-ocr // 支持免费在线体验 // API文档清晰提供多种接入语言示例如python、js、C#、java、php等以及自动化脚本语言如天诺、懒人精灵、按键精灵、易语言、EasyClick、触动精灵等 // // ----- 配置信息 ----- // 从石榴智能API市场获取API_KEY或SECRET_KEYhttps://market.shiliuai.com/ // import okhttp3.*; import com.alibaba.fastjson.JSON; import com.alibaba.fastjson.JSONObject; import javax.imageio.ImageIO; import java.awt.*; import java.awt.image.BufferedImage; import java.io.ByteArrayOutputStream; import java.io.File; import java.util.Base64; public class ScreenOCR { private static final String API_URL http(s)://ocr-api.shiliuai.com/api/advanced_general_ocr/v1; private static final String API_KEY YOUR_API_KEY; private static final String SECRET_KEY YOUR_SECRET_KEY; public static String screenshotAndRecognize(int x, int y, int x1, int y1) throws Exception { // 步骤1截图 Robot robot new Robot(); Rectangle rect new Rectangle(x, y, x1 - x, y1 - y); BufferedImage image robot.createScreenCapture(rect); ImageIO.write(image, png, new File(screenshot.png)); System.out.println(✅ 截图成功); // 步骤2图片转Base64 ByteArrayOutputStream baos new ByteArrayOutputStream(); ImageIO.write(image, png, baos); String base64Image Base64.getEncoder().encodeToString(baos.toByteArray()); // 步骤3调用OCR API OkHttpClient client new OkHttpClient(); JSONObject payload new JSONObject(); payload.put(image, base64Image); Request request new Request.Builder() .url(API_URL) .addHeader(Content-Type, application/json) .addHeader(X-API-Key, API_KEY) .addHeader(X-Secret-Key, SECRET_KEY) .post(RequestBody.create( MediaType.parse(application/json), payload.toJSONString() )) .build(); try (Response response client.newCall(request).execute()) { String respBody response.body().string(); JSONObject result JSON.parseObject(respBody); if (result.getInteger(code) 0) { String text result.getJSONObject(data).getString(text); System.out.println(✅ 识别结果 text); return text; } else { System.out.println(❌ 识别失败 result.getString(message)); return null; } } } public static void main(String[] args) throws Exception { screenshotAndRecognize(100, 100, 800, 500); } }4.3 JavaScriptNode.js接入代码// // 免费在线体验https://market.shiliuai.com/tools/ocr/general-text // API文档完整开发文档和代码示例https://market.shiliuai.com/doc/advanced-general-ocr // 支持免费在线体验 // API文档清晰提供多种接入语言示例如python、js、C#、java、php等以及自动化脚本语言如天诺、懒人精灵、按键精灵、易语言、EasyClick、触动精灵等 // // ----- 配置信息 ----- // 从石榴智能API市场获取API_KEY或SECRET_KEYhttps://market.shiliuai.com/ // const axios require(axios); const fs require(fs); const { exec } require(child_process); const util require(util); const execPromise util.promisify(exec); const API_URL http(s)://ocr-api.shiliuai.com/api/advanced_general_ocr/v1; const API_KEY YOUR_API_KEY; const SECRET_KEY YOUR_SECRET_KEY; async function screenshotAndRecognize() { // 步骤1截图使用screenshot-desktop库 // 需安装npm install screenshot-desktop const screenshot require(screenshot-desktop); const imgBuffer await screenshot({ format: png }); fs.writeFileSync(screenshot.png, imgBuffer); console.log(✅ 截图成功); // 步骤2图片转Base64 const base64Image imgBuffer.toString(base64); // 步骤3调用OCR API const payload { image: base64Image }; try { const response await axios.post(API_URL, payload, { headers: { Content-Type: application/json, X-API-Key: API_KEY, X-Secret-Key: SECRET_KEY }, timeout: 30000 }); const result response.data; if (result.code 0) { const text result.data.text; console.log(✅ 识别结果${text}); return text; } else { console.log(❌ 识别失败${result.message}); return null; } } catch (error) { console.error(请求异常${error.message}); return null; } } screenshotAndRecognize();4.4 PHP接入代码// // 免费在线体验https://market.shiliuai.com/tools/ocr/general-text // API文档完整开发文档和代码示例https://market.shiliuai.com/doc/advanced-general-ocr // 支持免费在线体验 // API文档清晰提供多种接入语言示例如python、js、C#、java、php等以及自动化脚本语言如天诺、懒人精灵、按键精灵、易语言、EasyClick、触动精灵等 // // ----- 配置信息 ----- // 从石榴智能API市场获取API_KEY或SECRET_KEYhttps://market.shiliuai.com/ // // 图片/pdf转base64 function get_base64($path){ if($fp fopen($path, rb, 0)) { $binary fread($fp, filesize($path));// 文件读取 fclose($fp); $b64 base64_encode($binary);// 转base64 }else{ $b64; printf(%s 文件不存在, $path); } return $b64; } $url https://ocr-api.shiliuai.com/api/advanced_general_ocr/v1; $appcode 你的appcode; $img_path 图片路径; $method POST; //请求头 $headers array(); array_push($headers, Authorization:APPCODE . $appcode); array_push($headers, Content-Type:application/json); //请求体 $b64 get_base64($img_path); $data array( file_base64 $b64 ); $post_data json_encode($data); // 请求 $curl curl_init(); curl_setopt($curl, CURLOPT_CUSTOMREQUEST, $method); curl_setopt($curl, CURLOPT_URL, $url); curl_setopt($curl, CURLOPT_HTTPHEADER, $headers); curl_setopt($curl, CURLOPT_FAILONERROR, false); curl_setopt($curl, CURLOPT_RETURNTRANSFER, true); curl_setopt($curl, CURLOPT_HEADER, true); curl_setopt($curl, CURLOPT_SSL_VERIFYPEER, false); curl_setopt($curl, CURLOPT_SSL_VERIFYHOST, false); curl_setopt($curl, CURLOPT_POSTFIELDS, $post_data); $result curl_exec($curl); var_dump($result);五、方案二自动化脚本工具集成6.1 懒人精灵 OCR API懒人精灵是免Root免越狱的移动端自动化工具支持Lua语言开发。核心流程截图 → Base64编码 → HTTP请求 → 解析结果。-- -- 免费在线体验https://market.shiliuai.com/tools/ocr/general-text -- API文档完整开发文档和代码示例https://market.shiliuai.com/doc/advanced-general-ocr -- 支持免费在线体验 -- API文档清晰提供多种接入语言示例如python、js、C#、java、php等以及自动化脚本语言如天诺、懒人精灵、按键精灵、易语言、EasyClick、触动精灵等 -- -- ----- 配置信息 ----- -- 从石榴智能API市场获取API_KEY或SECRET_KEYhttps://market.shiliuai.com/ -- -- 懒人精灵调用OCR API识别屏幕文字 local API_URL http(s)://ocr-api.shiliuai.com/api/advanced_general_ocr/v1 local API_KEY YOUR_API_KEY local SECRET_KEY YOUR_SECRET_KEY function recognizeScreen(x, y, x1, y1) -- 截图 local path /sdcard/ocr_temp.png snapShot(path, x, y, x1, y1) -- Base64编码 local image_base64 getFileBase64(path) local body jsonLib.encode({ image image_base64 }) -- HTTP请求 local headers { [Content-Type] application/json, [X-API-Key] API_KEY, [X-Secret-Key] SECRET_KEY } local response httpPost(API_URL, body, headers) local result jsonLib.decode(response) if result.code 0 then return result.data.text or else return end end -- 识别屏幕指定区域 local text recognizeScreen(100, 200, 800, 500) print(识别结果 .. text)6.2 按键精灵 OCR API按键精灵是国内最流行的自动化脚本工具之一支持通过HTTP请求调用OCR APIvb// // 免费在线体验https://market.shiliuai.com/tools/ocr/general-text // API文档完整开发文档和代码示例https://market.shiliuai.com/doc/advanced-general-ocr // 支持免费在线体验 // API文档清晰提供多种接入语言示例如python、js、C#、java、php等以及自动化脚本语言如天诺、懒人精灵、按键精灵、易语言、EasyClick、触动精灵等 // // ----- 配置信息 ----- // 从石榴智能API市场获取API_KEY或SECRET_KEYhttps://market.shiliuai.com/ // // 按键精灵调用OCR API识别屏幕文字 Dim API_URL, API_KEY, SECRET_KEY API_URL http(s)://ocr-api.shiliuai.com/api/advanced_general_ocr/v1 API_KEY YOUR_API_KEY SECRET_KEY YOUR_SECRET_KEY // 截图并保存 Call Plugin.Pic.PrintScreen(0, 0, 1024, 768, C:\screenshot.png) // 读取图片并转为Base64需使用插件 // ... Base64编码代码 ... // 发起HTTP POST请求 // ... HTTP请求代码 ... // 解析JSON返回结果 // ... JSON解析代码 ...6.3 EasyClick OCR APIEasyClick是另一款主流的移动端自动化工具同样支持OCR API集成javascript// // 免费在线体验https://market.shiliuai.com/tools/ocr/general-text // API文档完整开发文档和代码示例https://market.shiliuai.com/doc/advanced-general-ocr // 支持免费在线体验 // API文档清晰提供多种接入语言示例如python、js、C#、java、php等以及自动化脚本语言如天诺、懒人精灵、按键精灵、易语言、EasyClick、触动精灵等 // // ----- 配置信息 ----- // 从石榴智能API市场获取API_KEY或SECRET_KEYhttps://market.shiliuai.com/ // // EasyClick调用OCR API识别屏幕文字 let apiUrl http(s)://ocr-api.shiliuai.com/api/advanced_general_ocr/v1; let apiKey YOUR_API_KEY; let secretKey YOUR_SECRET_KEY; // 截图 let img captureScreen(); let base64 imageToBase64(img); // 调用OCR API let result http.post(apiUrl, { headers: { X-API-Key: apiKey, X-Secret-Key: secretKey }, body: { image: base64 } }); // 解析结果 let data JSON.parse(result); log(识别结果 data.data.text);七、屏幕截图质量优化建议截图质量直接影响OCR识别准确率请注意以下要点分辨率文字部分至少150dpi以上分辨率越高识别越准截图方式屏幕截图最佳 扫描仪 手机垂直拍照 手机倾斜拍照最差区域选择尽量只截取包含文字的区域避免无关背景干扰图片格式推荐PNG格式无损避免JPEG压缩带来的画质损失八、常见问题与解决方案Q1识别准确率能达到多少云端OCR API的识别准确率可达99%以上。屏幕截图属于高质量输入源识别效果通常优于手机拍摄。Q2本地OCR和云端API怎么选本地OCRTesseract/PaddleOCR免费、离线、数据安全但识别率相对较低、配置复杂云端API识别准确率高、开箱即用、支持多语言适合生产环境Q3支持哪些语言主流OCR API支持中文、英文、日文、韩文等多种语言部分还支持中英文混合识别。Q4图片有什么要求建议图片分辨率500×800以上文字清晰可辨经Base64编码后不超过10M。支持PNG、JPG、JPEG、BMP格式。Q5调用失败了怎么办常见原因图片格式不支持、图片过大、网络超时、API Key错误。建议检查图片格式和大小确认API凭证正确。九、总结屏幕文字识别技术已广泛应用于游戏辅助、办公自动化、RPA等场景。本文系统对比了4种主流实现方案并提供了Python、Java、JavaScript、PHP四种语言的完整接入代码以及懒人精灵、按键精灵、EasyClick等自动化脚本工具的集成示例。无论你是开发者还是自动化脚本爱好者都能在3分钟内快速上手。立即体验免费在线体验完整API文档API文档清晰提供多种接入语言示例如python、js、C#、java、php等以及自动化脚本语言如天诺、懒人精灵、按键精灵、易语言、EasyClick、触动精灵等注册送免费测试积分多语言SDK下载支持Python/Java/PHP/JS/C#/Go以及懒人精灵、按键精灵、易语言、EasyClick、触动精灵等自动化脚本语言相关阅读Python OCR文字识别API接入完整教程OCR识别接口哪个好2026主流OCR API对比评测懒人精灵OCR识别API实战手游脚本自动识别屏幕文字按键精灵调用OCR识别API完整教程零代码实现图片文字自动提取

相关新闻

采购人实操指南:如何从源头防控招标采购风险

采购人实操指南:如何从源头防控招标采购风险

对以投标为核心获客方式的企业来说,招投标全程布满风险点:轻则因细节失误导致废标,前期投入全部打了水漂;重则踩中合规红线,影响企业信用甚至被限制投标资格。很多企业只盯着标书制作,却忽略了从找标到履约…

2026/7/29 16:58:10 阅读更多 →
云服务器配置怎么选?CPU、内存、带宽和磁盘的实用配置思路

云服务器配置怎么选?CPU、内存、带宽和磁盘的实用配置思路

很多人在第一次购买云服务器时,都会遇到一个问题:配置到底怎么选? 控制台里有很多选项,比如 CPU、内存、带宽、系统盘、数据盘、地域、实例规格、计费方式。对于新手来说,很容易出现两种情况:一种是为了省…

2026/7/29 16:58:10 阅读更多 →
AI Agent工程管理:开发者向AI系统架构师转型指南

AI Agent工程管理:开发者向AI系统架构师转型指南

如果你是一名开发者,最近可能已经感受到了这种变化:过去你写代码、调试、部署,现在却要花更多时间设计提示词、配置模型参数、调试AI行为。这不是错觉——开发者的角色正在从"代码实现者"转变为"AI Agent的工程经理"。 …

2026/7/29 16:58:10 阅读更多 →

最新新闻

MCP 到底是什么?

MCP 到底是什么?

大模型会回答问题,但想让 AI 真正读取数据、调用工具、连接业务系统,就需要一套统一的连接方式。 MCP,全称 Model Context Protocol,可以理解为 AI 连接外部世界的通用接口。 它不是大模型,也不是 Agent 框架&#xff…

2026/7/29 17:10:16 阅读更多 →
基于ESP32-S3的MicroByte复古掌机:从硬件设计到模拟器集成的全流程实战

基于ESP32-S3的MicroByte复古掌机:从硬件设计到模拟器集成的全流程实战

1. 项目缘起:为什么是 ESP32 和 MicroByte? 几年前,我在整理旧物时翻出了一台老旧的 Game Boy,开机后那熟悉的像素画面和略显生涩的按键声,瞬间把我拉回了童年。但兴奋之余,一个问题冒了出来:这…

2026/7/29 17:10:16 阅读更多 →
多源异构通信数据统一识别:运营商分类分级平台关键技术与落地成

多源异构通信数据统一识别:运营商分类分级平台关键技术与落地成

云网融合、物联网、政企数字化业务持续扩张,运营商内部形成海量、多形态、跨域分散的异构通信数据,涵盖结构化业务库、半结构化信令日志、非结构化客服录音、基站测绘文件、离线工单文档等多类资产。传统分类分级工具仅适配单一数据库,无法统…

2026/7/29 17:10:16 阅读更多 →
北京创客嘉年华:与DFRobot深度面基,解锁开源硬件实战新体验

北京创客嘉年华:与DFRobot深度面基,解锁开源硬件实战新体验

1. 项目概述:一场不容错过的创客盛会 如果你是一位创客、教育工作者、硬件开发者,或者仅仅是对开源硬件、机器人、STEAM教育充满好奇的爱好者,那么“北京创客嘉年华”这个名字对你来说一定不陌生。而这次,它带来了一个更让人兴奋的…

2026/7/29 17:09:15 阅读更多 →
大模型时代来临!小白程序员如何免费收藏高薪技能,抢占职业先机?

大模型时代来临!小白程序员如何免费收藏高薪技能,抢占职业先机?

AI技术正在改变程序员职业命运,大模型重构技术开发范式。阿里、字节、腾讯等大厂纷纷布局AI,传统岗位面临转型,AI相关技术岗薪资逆势上涨。掌握AI大模型技术成为程序员投递简历的门槛。 2026开年,AI技术打得火热,正在改…

2026/7/29 17:09:15 阅读更多 →
基于红外遥控与STM32的智能灯光系统设计:从状态记忆到平滑调光

基于红外遥控与STM32的智能灯光系统设计:从状态记忆到平滑调光

1. 项目概述:从“能亮”到“好用”的智能灯光进化几年前,我给家里的床头灯加了个红外遥控开关,当时觉得挺方便,按一下遥控器就能开关灯,不用再伸手去够墙上的开关了。但用久了,问题就来了:遥控器…

2026/7/29 17:09:15 阅读更多 →

日新闻

【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

一、本文介绍 🔥本文在RT-DETR多模态融合目标检测中引入RLAB残差线性注意力模块,可在不同模态特征交互阶段进行多次残差细化,使可见光、红外等特征在尺度、语义和空间位置上更好对齐;随后将细化特征与解码器输出拼接并生成Q、K、V,通过线性注意力自适应强化关键通道、目…

2026/7/29 0:00:23 阅读更多 →
AI编程系列02:合并知识功能,给 AI 问数和 RAG 场景打基础

AI编程系列02:合并知识功能,给 AI 问数和 RAG 场景打基础

AI编程系列02:合并知识功能,给 AI 问数和 RAG 场景打基础 在上一期「AI编程系列」中,我们学习了如何构建一个基础的 AI 问答系统,通过简单的输入输出让模型回应问题。但现实世界中的 AI 应用往往需要处理更复杂的场景:…

2026/7/29 0:00:23 阅读更多 →
AI智能体开发实战:从工具调用到企业级部署

AI智能体开发实战:从工具调用到企业级部署

1. 从被动问答到主动执行:AI Agent的范式转变过去两年,大语言模型最显著的应用形态是聊天机器人——用户提问,AI回答。但真正的生产力革命发生在2023年下半年:当AI学会主动调用工具完成任务时,生产力工具的历史被彻底改…

2026/7/29 0:00:23 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/28 12:04:22 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/29 14:34:28 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/29 15:00:03 阅读更多 →

月新闻