英汉词典数据库 ECDICT 实战指南:一个文件解决你阅读工具的词形、词频与模糊匹配难题
英汉词典数据库 ECDICT 实战指南一个文件解决你阅读工具的词形、词频与模糊匹配难题【免费下载链接】ECDICTFree English to Chinese Dictionary Database项目地址: https://gitcode.com/gh_mirrors/ec/ECDICT每次想给阅读器、背单词 App 或翻译插件加一个靠谱的英汉词典你是不是都会卡在同一个环节查gave提示未收录查perceived也无结果想按四六级筛选词汇却拿不到标注数据。与其自造轮子不如直接用ECDICT 英汉词典数据库——这份开源数据内置 76 万词条、双词频与考试标签并附带一套 Python 接口把词形变化、词干还原和模糊匹配一次补齐。为什么值得用三个其他词典数据给不了的差异点1. 它把单词的亲戚关系都存下来了绝大多数词典数据只有单词 → 释义的映射动词时态、名词复数只能靠你自己写算法猜。ECDICT 的exchange字段记录了每个词的完整词形变化perceive 的数据长这样d:perceived/p:perceived/3:perceives/i:perceiving含义是过去分词d、过去式p、第三人称单数3、现在分词i。这让你做阅读器时遇到任意变形都能直接跳回原词展示释义而不是弹出一句未收录。2. 词频不是单一维度而是传统与现代双轨bnc是英国国家语料库的词频排名覆盖几百年历史文献frq是当代语料库排名最近 20 年。同一单词在两个榜单里可能天差地别——quay码头在 BNC 排 8906 名当代语料库却跌出两万Taliban 恰好相反。如果你做的是名著阅读工具bnc更值得参考做科技资讯阅读器frq更贴近现实。一次查询两种口径都在手里。3. 附带一份 1 亿词条语料训练出的词干数据库lemma.en.txt扫描了 BNC 全部一亿个词条把gave → give、teeth → tooth这类不规则的还原关系直接写死在数据库里。对做词频统计、拼写检查的人来说这比任何基于词尾猜测的算法都可靠。从零跑通五分钟做出你的第一个词典查询环境要求只有 Python 3无需安装任何第三方依赖。先把数据拉下来git clone https://gitcode.com/gh_mirrors/ec/ECDICT cd ECDICT仓库里的stardict.py是唯一要用的接口文件ecdict.csv是 76 万词条的基础版数据。写个最小查询脚本from stardict import DictCsv d DictCsv(ecdict.csv) # 加载约 4~5 秒 word d.query(perceive) print(word[translation]) print(词频:, word[bnc], word[frq]) print(考试标签:, word[tag])预期输出在当前数据上实测vt. 感觉, 认知, 理解, 意识到 词频: 2776 2165 考试标签: cet4 cet6 ky toefl ielts到这里你已经能查任意单词了。查询接口对大小写不敏感query(Perceive)与query(perceive)结果一致。深入实战三个能直接搬进业务场景的用法场景一给背单词工具做考试词汇 词频双筛选要做一套四六级词汇表用tag字段过滤即可还能结合双词频按重要性排序from stardict import DictCsv d DictCsv(ecdict.csv) def exam_words(exam, limit20): result [] for _, word in d: # 遍历全部词条 data d.query(word) if exam in data[tag] and data[frq]: result.append((data[frq], word)) result.sort() # 按当代词频升序 return [w for _, w in result[:limit]] print(exam_words(cet4)[:5])这段代码筛出四级词并取当代语料库中最常用的 5 个输出形如[a, of, to, and, in]做 Anki 卡片时把词频、柯林斯星级、时态信息一并拼进卡片模板学习排序就自动合理了。场景二抓词软件遇到变形词先用词干还原再查词典阅读器里鼠标取词最烦的就是取到gave、taken这类变形。正确的处理链路是词干还原 → 词典查询 → 模糊匹配兜底from stardict import DictCsv, LemmaDB d DictCsv(ecdict.csv) lm LemmaDB() lm.load(lemma.en.txt) # 加载词干库约 8 万组 def lookup(word): data d.query(word) if data: return data stems lm.word_stem(word) # 变形词 → 原型 if stems: return d.query(stems[0]) return None print(lookup(gave)[translation][:30])gave的词干是give所以最终打印的是 give 的中文释义前 30 个字符。实测[gave, taken, teeth]分别还原为[give, take, tooth]不规则的teeth也一次命中。场景三CSV 太慢一行代码转 SQLite查询提速到毫秒级CSV 加载需要 4~5 秒本地工具用起来还是偏慢。stardict.py提供了格式转换接口转换后单次查询在毫秒级from stardict import convert_dict, StarDict convert_dict(ecdict.db, ecdict.csv) # CSV → SQLite s StarDict(ecdict.db) # 直接读 SQLite print(s.query(perceive)[phonetic])转换只需运行一次之后StarDict与DictCsv的接口完全一致——query、match、query_batch、count全部通用业务代码不用改一行。这也是项目作者自己推荐的使用方式日常查询用 SQLite修订数据时才用 CSV。附赠模糊匹配的隐藏字段swstardict.py的match(word, limit, strip)第三个参数设为True时会走swstrip-word索引忽略连字符与空格。搜索long-time时能同时找到longtime、long time等所有形态——实测匹配结果里前五项就是longtime, long time ago, long-time burning oil, ...。用户拼写不规范时这一招能救回大量查询失败。避坑与调优最常踩的 4 个坑别用 Excel 直接打开 ecdict.csv。数据是 UTF-8 编码直接双击会乱码。要么用代码读取要么在 Excel 里走数据 → 从文本导入指定逗号分割和 UTF-8 编码。exchange里偶发冗余标签。早期数据存在f复数、b比较级、z最高级这些与s/r/t重复的旧标签。仓库里的del_bfz.py专门做清洗转换库之前可以先跑一遍不影响主流程。MySQL 版本需要额外驱动。DictMySQL依赖MySQLdb没装会直接抛ImportError: No module named MySQLdb。单机应用优先选 SQLite省心且足够快。词干查询是首选算法才是兜底。lemma.en.txt覆盖了 BNC 语料中 95% 的变形但查不到时不要硬编规则先用match(..., stripTrue)模糊匹配两者都失败再考虑写后缀判断。生态与扩展这些文件各有用武之地文件作用适合场景ecdict.csv/stardict.7z基础版 / 完整版数据直接查询、PR 修订lemma.en.txt8.4 万组词干数据词频统计、取词还原dictutils.py词典生成与转换工具导出 StarDict / mdx / Anki 模板wordroot.txt词根词缀资料JSON词源学习功能resemble.txt近义词辨析数据辨析类词典扩展linguist.pyWordNet / NodeBox 封装获取英文释义、生成词形社区已有 T.vim、Trans.nvim 等编辑器翻译插件基于 ECDICT 构建如果你的项目是 Vim/Neovim 插件可以直接参考它们的接入方式。数据本身是 CSV 纯文本随时可以 fork 一份自己修订词条改完再合并回来。下一步现在就能动手的三件事第一把仓库 clone 到本地用上面的最小脚本查 10 个你最近学到的单词看看exchange、tag、双词频这些字段长什么样第二写一个convert_dict把数据转成 SQLite体验毫秒级查询第三把你手头某个查不到变形词的老功能接上LemmaDB你会立刻看到取词失败率的下降。如果对某个字段比如pos里的词性比例n:46/v:54或某种转换格式有疑问仓库里的README.md字段说明和stardict.py自带测试用例就是最好的参考文档。数据在手剩下的就交给你的想象力了。【免费下载链接】ECDICTFree English to Chinese Dictionary Database项目地址: https://gitcode.com/gh_mirrors/ec/ECDICT创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

基于NE555的熔断器状态指示电路设计与实现

基于NE555的熔断器状态指示电路设计与实现

1. 从一次“盲盒”故障说起:为什么我们需要熔断器状态指示 前几天晚上,我正在书房里调试一个给模型火车供电的小型直流电源。突然,工作台上的台灯闪了一下,紧接着,那个我精心焊接的电源模块就彻底没了动静。我第一反应…

2026/8/19 1:35:14 阅读更多 →
如何让阴阳师每天少肝3小时?这份阴阳师自动化脚本新手指南请收好

如何让阴阳师每天少肝3小时?这份阴阳师自动化脚本新手指南请收好

如何让阴阳师每天少肝3小时?这份阴阳师自动化脚本新手指南请收好 【免费下载链接】OnmyojiAutoScript Onmyoji Auto Script | 阴阳师脚本 项目地址: https://gitcode.com/gh_mirrors/on/OnmyojiAutoScript 晚上十点下班到家,悬赏封印还差两单、御…

2026/8/19 1:35:14 阅读更多 →
RADISYS SBC3861220F08M 通讯接口模块

RADISYS SBC3861220F08M 通讯接口模块

RADISYS SBC3861220F08M 通讯接口模块 产品简介RADISYS SBC3861220F08M 是瑞迪斯(RADISYS)公司推出的一款通讯接口模块,主要用于工业通信系统中的数据转换、协议匹配与信号传输,实现不同设备或系统之间的可靠通信连接。产品参数产…

2026/8/19 1:35:14 阅读更多 →

最新新闻

掌握5种AE核心动画技法,轻松打造电影级动态图形

掌握5种AE核心动画技法,轻松打造电影级动态图形

如果你在B站、YouTube或者各类设计社区里,经常刷到那些让人眼前一亮的动态图形——比如充满科技感的HUD界面、丝滑流畅的Logo演绎、或是电影片头里极具冲击力的文字动画——心里大概会闪过两个念头:一是“这效果太酷了,我也想做”&#xff0c…

2026/8/19 3:33:16 阅读更多 →
AI智能体如何自主合成与优化6G无线接入网架构

AI智能体如何自主合成与优化6G无线接入网架构

1. 从概念到现实:为什么我们需要一个能“自主合成”6G网络的AI?如果你最近关注通信技术的前沿,可能会被一个词刷屏:6G。但和5G、4G时代不同,现在大家讨论的焦点,除了更快的速率和更低的延迟,越来…

2026/8/19 3:33:16 阅读更多 →
智能体编排的贝叶斯一致性:从决策理论到工程实践

智能体编排的贝叶斯一致性:从决策理论到工程实践

1. 项目概述:为什么“智能体编排”必须拥抱贝叶斯一致性?最近和几个做AI应用落地的朋友聊天,大家普遍有个感觉:现在的“智能体”(Agentic AI)项目,Demo跑起来很酷,但一到真实业务流里…

2026/8/19 3:33:16 阅读更多 →
当贝D7X Pro超亮版和Vidda M2Pro高亮版对比,选哪个不后悔?

当贝D7X Pro超亮版和Vidda M2Pro高亮版对比,选哪个不后悔?

最近3K价位卧室投影仪市场又添新选手,当贝D7X Pro超亮版刚刚发布,作为上一代D7XPro的全新升级款,亮度、对比度、护眼配置都往上拉了一档。身边很多原本在看Vidda M2 Pro高亮版的朋友,开始在这两款之间纠结了,今天就把两…

2026/8/19 3:33:16 阅读更多 →
Arduino驱动交流接触器实现潜水泵自动控制:硬件选型与安全电路设计

Arduino驱动交流接触器实现潜水泵自动控制:硬件选型与安全电路设计

1. 项目缘起:为什么用Arduino控制潜水泵?如果你在搞农业灌溉、鱼塘增氧、地下室排水或者任何需要用到潜水泵的场景,可能都遇到过类似的问题:手动开关泵太麻烦,定时器不够灵活,市面上的自动控制器要么功能单…

2026/8/19 3:33:16 阅读更多 →
AI智能体轨迹归因:构建长视野决策诊断的统一基准与标注框架

AI智能体轨迹归因:构建长视野决策诊断的统一基准与标注框架

1. 项目概述:为什么我们需要一个“长视野”的智能体轨迹归因基准?最近在AI智能体(Agent)的圈子里,大家讨论的热点已经从“能不能做”转向了“做得好不好、为什么好”。我们训练一个智能体,比如一个游戏AI或…

2026/8/19 3:32:16 阅读更多 →

日新闻

【单片机课程设计/毕业设计】基于 STM32 与 WiFi 模块的室内通风智能管控系统设计 基于 STM32 的人体存在感知自适应风扇控制系统设计(018503)

【单片机课程设计/毕业设计】基于 STM32 与 WiFi 模块的室内通风智能管控系统设计 基于 STM32 的人体存在感知自适应风扇控制系统设计(018503)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于嵌入式单片机,Java、小程序技术领域和毕业项目实战 ✌️…

2026/8/19 0:00:30 阅读更多 →
AI如何驱动数学猜想生成:从大语言模型到自动化数学发现

AI如何驱动数学猜想生成:从大语言模型到自动化数学发现

1. 项目概述:当AI开始“猜”数学定理 最近在AI研究圈里,一个名为“Moonshine”的项目引起了不小的讨论。这名字本身就挺有意思,直译是“月光”,但在数学史上,它特指一个神秘而美丽的联系——魔群月光猜想,连…

2026/8/19 0:00:30 阅读更多 →
WarcraftHelper 魔兽争霸3优化实战指南

WarcraftHelper 魔兽争霸3优化实战指南

WarcraftHelper 魔兽争霸3优化实战指南 【免费下载链接】WarcraftHelper Warcraft III Helper , support 1.20e, 1.24e, 1.26a, 1.27a, 1.27b 项目地址: https://gitcode.com/gh_mirrors/wa/WarcraftHelper 一台刚配的新电脑,跑《魔兽争霸3》却卡成 PPT——这…

2026/8/19 0:02:31 阅读更多 →

周新闻

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

如果你是一名开发者,最近可能已经感受到了AI大模型正在从“玩具”变成“生产力工具”的强烈信号。从代码补全到智能Agent,从本地部署到云端API,我们正处在一个技术栈快速重构的节点。然而,面对层出不穷的模型、框架和工具&#xf…

2026/8/18 9:15:35 阅读更多 →
工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/18 9:06:28 阅读更多 →
【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

2026/8/18 9:04:56 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/17 18:54:37 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/17 18:55:16 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/17 18:55:55 阅读更多 →