25美元把普通眼镜变成AI终端:OpenGlass零基础到实时识别的完整上手指南
25美元把普通眼镜变成AI终端OpenGlass零基础到实时识别的完整上手指南【免费下载链接】OpenGlassTurn any glasses into AI-powered smart glasses项目地址: https://gitcode.com/GitHub_Trending/op/OpenGlass戴上它的第一分钟你会看到什么花一杯奶茶的价格让你现在戴的眼镜开口说话——这不是科幻片而是 OpenGlass 正在做的事。这个开源项目把任意普通镜框变成一台能看、能听、能记的 AI 设备认出面前是谁、读出路牌和菜单上的文字、记住你一天里见过的人和事然后像贴身秘书一样回答你的提问。它不需要你懂电路不需要昂贵的专用硬件核心就是一块几十元的 ESP32 S3 开发板加上一段开源固件。这篇文章不按硬件讲解→软件讲解的老套路来而是沿着一条真实的完整链路走从眼镜按下快门那一刻到手机屏幕上弹出答案中间到底发生了什么、每一步需要你做什么全部拆开给你看。一、先弄懂它怎么看见和回答按下快门的瞬间数据走了四步OpenGlass 的整个工作流可以用一句话概括眼镜负责采集云端负责理解App 负责对话。完整链路如下镜架上的 ESP32 S3 摄像头抓拍画面firmware/firmware.ino把照片通过蓝牙BLE推送到手机端音频则按mulaw或PCM编码后同步传输手机端的 Expo 应用收到照片交给sources/agent/Agent.ts处理它会调用视觉模型把图片翻译成一段文字描述每张照片的描述被积累起来成为你的记忆库当你提问时llamaFind把所有描述拼成一份材料交给大语言模型检索作答再把答案显示在屏幕上。这里藏着一个巧妙的设计眼镜本身不思考只负责拍照。所有看懂的工作都发生在云端这让硬件成本被压到极低也让模型可以随时替换升级。为什么要先描述、再回答打个比方想象你给一个没到过现场的朋友发消息与其直接甩一张原图过去不如先告诉他我面前坐着一个穿蓝衣服的人桌上放着咖啡。OpenGlass 正是这么做的——先用视觉模型把照片转成文字再用文字模型回答问题。好处是双重的语言模型的理解能力远比直接看图稳定而且每次拍照的描述被保留下来后你可以反过来追问今天下午我见过谁相当于给自己建了一本自动书写的日记。代码里这个分工非常清晰sources/agent/imageDescription.ts负责看图说话llamaFind/openAIFind负责有问必答视觉模型走本地 Ollama问答模型走 Groq 或 OpenAI。二、硬件准备一张清单三步装完全部零件只要三样零件作用参考成本Seeed Studio XIAO ESP32 S3 Sense集成了摄像头、Wi-Fi、蓝牙的大脑含麦克风约 20 美元3.7V 250mAh 锂电池带 JST 接口给整机供电体积小到能藏进镜腿几美元3D 打印镜架壳把开发板和电池固定到镜框上打印成本几乎为零如果你有 3D 打印机直接使用项目提供的 STL 文件打印外壳没有的话找一家代打服务也花不了几块钱。整个组装不需要焊接电池插上 JST 接口、开发板卡进外壳即可。上传固件Arduino IDE 还是命令行任选推荐图形界面打开firmware/firmware.ino在 Arduino IDE 中完成两步准备工作——先把 ESP32 板卡包地址填入文件→首选项再在工具→开发板管理器中搜索并安装 esp32 包随后选择XIAO_ESP32S3板和对应串口。喜欢命令行的朋友可以参考 firmware/readme.md 里的 arduino-cli 方案一条命令完成编译上传arduino-cli compile --build-path build --output-dir dist -e -u -p COM5 -b esp32:esp32:XIAO_ESP32S3:PSRAMopi三、新手最容易踩的3个坑提前排雷坑一忘开 PSRAM固件直接崩溃这是最高频的翻车点。ESP32 S3 的摄像头缓冲区需要额外的 PSRAM 内存上传前务必到工具→PSRAM下拉菜单里把它设为OPI PSRAM。跳过这一步设备会反复重启或死机而报错往往晦涩难懂。这一项先设好后面能省一小时排查时间。坑二端口识别混乱找不到板子Windows 下板子可能被识别成nora_w10、wifiduino32c3等奇怪型号。别慌用这条命令查看真实端口和板卡信息arduino-cli board list arduino-cli board details -b esp32:esp32:XIAO_ESP32S3把命令输出里的端口号如 COM5替换到编译指令中即可。坑三音频编码不对App 里没声音固件顶部定义了三种音频编码Opus开发中、Mulaw配合网页版使用、PCM配合 Omi/Friend 应用使用。用网页版就把CODEC_PCM注释掉、取消CODEC_MULAW的注释。另外如果要用 Opus需要手动向 Arduino 库目录克隆arduino-libopus和arduino-audio-tools两个依赖库路径可用arduino-cli config get directories.user查询。四、软件配置填密钥、拉模型、起服务keys.ts三把钥匙一次配齐项目把密钥管理统一放在sources/keys.ts不需要再折腾.env文件。打开后填入三样东西Groq 的 API 密钥用于问答、OpenAI 的 API 密钥备用问答通道、以及本地 Ollama 服务的地址。格式如下export const keys { groq: process.env.EXPO_PUBLIC_GROQ_API_KEY ?? , ollama: process.env.EXPO_PUBLIC_OLLAMA_API_URL ?? , openai: process.env.EXPO_PUBLIC_OPENAI_API_KEY ?? , };拉取本地视觉模型视觉识别走的是本地 Ollama在终端执行一条命令下载推荐的轻量模型ollama pull moondream:1.8b-v2-fp16这个模型体积小、速度快是sources/agent/imageDescription.ts里的默认选择也是官方默认的识别引擎。随后克隆仓库、安装依赖git clone https://gitcode.com/GitHub_Trending/op/OpenGlass cd OpenGlass yarn install启动应用并连接眼镜yarn start这是一个 Expo 项目启动后会在终端给出 localhost 链接用浏览器打开即可看到操作界面。点击界面上的 Connect to the device 按钮选择名为OpenGlass的蓝牙设备完成配对——这个连接逻辑写在sources/modules/useDevice.ts中设备服务 UUID 与固件端保持一致。到这里你的眼镜就上线了。五、第一次看见识别测试与追问玩法戴上眼镜看向四周屏幕上会逐条浮现 AI 对画面的描述。想验证效果可以翻看prompts/series_1/目录——这是一组现成的测试样例每张照片都配有四种模型输出的描述对比文档。下图就是测试集中的真实场景图测试场景示例——AI 需要准确描述画面主体、环境细节与文字信息你可能会好奇不同模型对同一张图的眼力差距有多大项目为此内置了一个评测脚本prompts/generate.ts一键批量跑四个模型的识别效果yarn prompts脚本会遍历prompts/series_1/下所有图片依次用默认模型moondream、llava-llama3、llava:34b-v1.6、moondream:1.8b-v2-fp16生成描述并把结果写入对应的.md文件。对比img_1.md你会发现轻量模型描述简洁直接大模型则会把环境、光线、人物细节都铺展开——这就是选择模型的权衡点也顺带帮你摸清哪些场景适合哪种模型。更进阶的玩法是追问。sources/agent/Agent.ts会保存每张照片的文字描述你随时可以问我刚刚看到的那个人穿什么颜色的衣服它会在记忆里检索后作答。如果拍糊了项目里还有imageBlurry.ts这个模糊检测模块当前为实验性未来可以自动筛掉废片。六、到这里你的眼镜能做什么了从组装到跑通你已经拥有了一台可对话的 AI 眼镜。接下来是它真正有趣的地方——这是一套完全开放的流水线想改采集频率去firmware/firmware.ino调整拍摄节奏想换识别引擎在sources/agent/imageDescription.ts里指定新的 Ollama 模型想加新能力sources/agent/下还有音频启动等模块可以组合想看看官方踩坑经验firmware/readme.md 里记录了完整的 arduino-cli 流程与板卡兼容性说明。一个小提醒项目官方已将代码迁移至 Omi 仓库本仓库不再持续维护但作为学习与二次开发的起点依然完整可用。下一步建议你亲手测一组自己的照片跑一次yarn prompts把四个模型的结果并排看一遍——你会在对比中真正理解视觉模型这四个字的分量。等你能熟练替换模型、调整参数之后欢迎把改进提交回社区让更多人的眼镜变得更聪明。别让这副 25 美元的眼镜只停在能看的层面它的上限由你决定。【免费下载链接】OpenGlassTurn any glasses into AI-powered smart glasses项目地址: https://gitcode.com/GitHub_Trending/op/OpenGlass创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

Webshell攻防实战:从文件上传到RCE漏洞的Getshell路径解析

Webshell攻防实战:从文件上传到RCE漏洞的Getshell路径解析

1. 从“入口”到“控制”:理解Getshell的本质在网络安全领域,尤其是渗透测试和应急响应中,“Getshell”是一个高频且核心的词汇。它听起来像是一个单一的动作,但实际上,它代表了一个从发现漏洞到最终获取服务器命令行控…

2026/8/15 15:54:42 阅读更多 →
Natlas安全最佳实践:从CSRF防护到TLS配置的全方位防护策略

Natlas安全最佳实践:从CSRF防护到TLS配置的全方位防护策略

Natlas安全最佳实践:从CSRF防护到TLS配置的全方位防护策略 【免费下载链接】natlas Attack Surface Management since before Attack Surface Management was a thing 项目地址: https://gitcode.com/gh_mirrors/na/natlas Natlas作为一款专注于攻击面管理的…

2026/8/15 15:54:42 阅读更多 →
StringBuffer、StringBuilder、StringJoiner区别

StringBuffer、StringBuilder、StringJoiner区别

一、StringBuffer线程安全性:✅ 线程安全(所有方法都是 synchronized)。可变性:可变字符序列。性能:由于同步开销,性能比 StringBuilder 差。适用场景:多线程环境下需要频繁修改字符串时使用。J…

2026/8/15 15:54:42 阅读更多 →

最新新闻

JSON文件翻译终极指南:用jsontt命令行工具一键批量搞定多语言,全程免费

JSON文件翻译终极指南:用jsontt命令行工具一键批量搞定多语言,全程免费

JSON文件翻译终极指南:用jsontt命令行工具一键批量搞定多语言,全程免费 【免费下载链接】json-translator jsontt 💡 - AI JSON Translator with GPT / Gemma / Mixtral / llama other FREE translation modules to translate your json/yam…

2026/8/15 17:14:10 阅读更多 →
linux下的各种I/O多路复用详解---select/poll/epoll

linux下的各种I/O多路复用详解---select/poll/epoll

多路复用技术是一种通过共享物理信道实现多路信号传输的通信技术,其核心原理是利用复用器将多路信号合成单一信号传输,接收端通过分用器分离还原。该技术主要包括频分复用(FDM)、时分复用(TDM)、波分复用&a…

2026/8/15 17:14:10 阅读更多 →
一次虚拟机翻车引发的思考:不用 Mac 也能从 Apple 服务器下载 macOS

一次虚拟机翻车引发的思考:不用 Mac 也能从 Apple 服务器下载 macOS

一次虚拟机翻车引发的思考:不用 Mac 也能从 Apple 服务器下载 macOS 【免费下载链接】gibMacOS Py2/py3 script that can download macOS components direct from Apple 项目地址: https://gitcode.com/gh_mirrors/gi/gibMacOS 周五晚上十一点,我…

2026/8/15 17:14:10 阅读更多 →
atc-react与MITRE ATTCK集成指南:提升威胁狩猎效率的终极技巧

atc-react与MITRE ATTCK集成指南:提升威胁狩猎效率的终极技巧

atc-react与MITRE ATT&CK集成指南:提升威胁狩猎效率的终极技巧 【免费下载链接】atc-react A knowledge base of actionable Incident Response techniques 项目地址: https://gitcode.com/gh_mirrors/at/atc-react atc-react作为一个专注于事件响应技术…

2026/8/15 17:14:10 阅读更多 →
免费法线贴图生成工具实战:拖一张灰度图,三步做出专业级凹凸质感

免费法线贴图生成工具实战:拖一张灰度图,三步做出专业级凹凸质感

免费法线贴图生成工具实战:拖一张灰度图,三步做出专业级凹凸质感 【免费下载链接】NormalMap-Online NormalMap Generator Online 项目地址: https://gitcode.com/gh_mirrors/no/NormalMap-Online 晚上十点,你盯着游戏场景里那块光秃秃…

2026/8/15 17:14:10 阅读更多 →
抖音批量下载工具怎么用:一次配置,跑完整条作者主页

抖音批量下载工具怎么用:一次配置,跑完整条作者主页

抖音批量下载工具怎么用:一次配置,跑完整条作者主页 【免费下载链接】douyin-downloader A practical Douyin downloader for both single-item and profile batch downloads, with progress display, retries, SQLite deduplication, and browser fallb…

2026/8/15 17:13:10 阅读更多 →

日新闻

内景 空间站内部 中国空间站 太空 内仓

内景 空间站内部 中国空间站 太空 内仓

本项目为前几天收费帮学妹做的一个项目,在工作环境中基本使用不到,但是很多学校把这个当作编程入门的项目来做,故分享出本项目供初学者参考。 一、项目描述 空间站内部 中国空间站 太空 内仓 地址:本地PC端运行(或Web…

2026/8/15 0:00:30 阅读更多 →
重新定义数据接口:3个突破性场景让通达信数据读取更智能

重新定义数据接口:3个突破性场景让通达信数据读取更智能

重新定义数据接口:3个突破性场景让通达信数据读取更智能 【免费下载链接】mootdx 通达信数据读取的一个简便使用封装 项目地址: https://gitcode.com/GitHub_Trending/mo/mootdx 当我们面对海量金融数据时,传统的数据获取方式往往让我们陷入困境—…

2026/8/15 0:00:30 阅读更多 →
一文读懂快消WMS怎么选?2026年国内外10大主流WMS品牌盘点

一文读懂快消WMS怎么选?2026年国内外10大主流WMS品牌盘点

快消品(FMCG)是流通速度较快、竞争较为激烈的行业之一。一瓶饮料从出厂到消费者手中,往往只有几十天甚至几天的周转窗口。这决定了快消行业的仓储管理系统(WMS)与制造业、电商行业存在明显区别:它不仅需要管…

2026/8/15 0:02:30 阅读更多 →

周新闻

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁 【免费下载链接】baidupankey 在线查询网盘提取码(维护中 rm repo) 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 你是否曾经在深夜寻找一份重要资料&#x…

2026/8/13 2:38:34 阅读更多 →
如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/15 12:59:14 阅读更多 →
收藏!小白程序员轻松入门大模型,从Harness工程开始实践

收藏!小白程序员轻松入门大模型,从Harness工程开始实践

文章强调学习大模型不应只关注模型本身,而应重视模型外的系统搭建,即Harness。提出AgentModelHarness的实用公式,详细介绍Harness的四个层次:持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.…

2026/8/13 10:41:51 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/14 13:40:53 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/14 14:06:45 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/15 2:35:29 阅读更多 →