HMM(隐马尔可夫模型)用于 NER 时,其隐状态和观测状态分别对应什么?
HMM 用于 NER 时的隐状态与观测状态一、HMM 基本框架回顾HMM 是一个双重随机过程隐状态链: z₁ → z₂ → z₃ → ... → zₙ 马尔可夫转移不可直接观测 ↑ ↑ ↑ ↑ 观测序列: x₁ x₂ x₃ ... xₙ 由隐状态生成可观测两个核心假设马尔可夫假设当前隐状态只依赖前一个隐状态P(zt∣zt−1)P(z_t|z_{t-1})P(zt​∣zt−1​)观测独立假设当前观测只依赖当前隐状态P(xt∣zt)P(x_t|z_t)P(xt​∣zt​)二、NER 中的对应关系隐状态 实体标签序列隐状态是不可直接观测的、需要推断的目标对应每个词或字的 NER 标签。采用 BIO 编码方案时隐状态集合为隐状态含义B-PER人名起始I-PER人名内部B-ORG机构起始I-ORG机构内部B-LOC地名起始I-LOC地名内部O非实体若实体类别有 K 种隐状态数量 2K12K 12K1每个类别 B/I 各一个 O。观测状态 输入文本序列观测状态是可直接看到的输入对应句子中的每个词或字。具体示例观测序列(词): 苹果 公司 在 加州 成立 于 1976年 ↑ ↑ ↑ ↑ ↑ ↑ ↑ 隐状态(标签): B-ORG I-ORG O B-LOC O O B-DATEHMM 要素NER 对应说明隐状态ztz_tzt​第 t 个词的 NER 标签不可观测需推断观测xtx_txt​第 t 个词本身可直接观测的输入初始概率π\piπ句首词的标签分布句首更可能是 B-X 或 O不太可能是 I-X转移概率AAA标签间的转移概率如 B-ORG→I-ORG 概率高I-ORG→B-PER 概率低发射概率BBB给定标签时词的概率如 P(“公司”|I-ORG) 较高P(“公司”|B-LOC) 较低三、三个概率矩阵的具体含义1. 初始概率π\piππiP(z1si)\pi_i P(z_1 s_i)πi​P(z1​si​)句首位置的标签分布π(B-ORG) 0.15 句首常以机构名开头 π(B-PER) 0.10 句首常以人名开头 π(O) 0.60 句首最常见的是非实体词 π(I-ORG) 0.01 句首极少是实体内部词结构约束2. 转移概率AAAAijP(ztsj∣zt−1si)A_{ij} P(z_t s_j \mid z_{t-1} s_i)Aij​P(zt​sj​∣zt−1​si​)标签间的转移规律体现 BIO 结构约束前一标签 → 当前标签转移概率解释B-ORG → I-ORG高 (0.7)实体起始后通常跟内部词I-ORG → I-ORG中 (0.4)多词实体继续延伸I-ORG → O中 (0.3)实体结束转为非实体I-ORG → B-PER低 (0.05)实体结束后开始新实体O → I-ORG极低 (0.01)非实体不能直接跳到实体内部B-ORG → B-LOC低 (0.05)两个实体直接相邻较少转移概率天然编码了 BIO 标签的结构合法性约束这是 HMM 用于序列标注的优势。3. 发射概率BBBBi(w)P(xtw∣ztsi)B_i(w) P(x_t w \mid z_t s_i)Bi​(w)P(xt​w∣zt​si​)给定标签时观测到某词的概率P(公司 | I-ORG) 0.08 公司常出现在机构名内部 P(公司 | B-LOC) 0.001 公司极少作为地名起始 P(在 | O) 0.05 在是非实体高频词 P(苹果 | B-ORG) 0.03 苹果常作为机构名起始 P(苹果 | O) 0.01 苹果偶尔作为普通名词水果四、NER 推断过程给定观测序列句子HMM 通过Viterbi 算法求解最大后验概率的隐状态序列标签序列Y^arg⁡max⁡YP(Y∣X)arg⁡max⁡Y∏t1nP(xt∣yt)⋅P(yt∣yt−1)⋅π(y1)\hat{Y} \arg\max_Y P(Y|X) \arg\max_Y \prod_{t1}^{n} P(x_t|y_t) \cdot P(y_t|y_{t-1}) \cdot \pi(y_1)Y^argYmax​P(Y∣X)argYmax​t1∏n​P(xt​∣yt​)⋅P(yt​∣yt−1​)⋅π(y1​)Viterbi 动态规划递推δt(j)max⁡i[δt−1(i)⋅Aij]⋅Bj(xt)\delta_t(j) \max_i \left[ \delta_{t-1}(i) \cdot A_{ij} \right] \cdot B_j(x_t)δt​(j)imax​[δt−1​(i)⋅Aij​]⋅Bj​(xt​)位置: 1 2 3 4 观测: 苹果 公司 在 加州 ↓ ↓ ↓ ↓ ↓ ↓ ↓ ↓ Viterbi逐位计算最优路径: t1: δ(B-ORG) π(B-ORG) × B(B-ORG|苹果) ← 最优 t2: δ(I-ORG) δ(B-ORG) × A(B-ORG→I-ORG) × B(I-ORG|公司) ← 最优 t3: δ(O) δ(I-ORG) × A(I-ORG→O) × B(O|在) ← 最优 t4: δ(B-LOC) δ(O) × A(O→B-LOC) × B(B-LOC|加州) ← 最优 最优路径: B-ORG → I-ORG → O → B-LOC五、HMM 用于 NER 的局限性局限说明观测独立假设过强HMM 假设P(xt∣zt)P(x_t|z_t)P(xt​∣zt​)只依赖当前词无法利用上下文词信息。但 NER 中苹果是 ORG 还是 MISC取决于上下文“苹果发布财报” vs “吃了个苹果”生成模型方向反了HMM 建模P(x∣z)P(x|z)P(x∣z)标签生成词但实际任务是P(z∣x)P(z|x)P(z∣x)词推断标签生成式建模引入了不必要的建模负担特征利用受限难以融入丰富的重叠特征词缀、词性、词典匹配等而 CRF 等判别模型可灵活使用任意特征这些局限正是 CRF条件随机场和 BiLSTM-CRF 等方法取代 HMM 的原因CRF 直接建模P(Y∥X)P(Y\|X)P(Y∥X)且可利用丰富上下文特征BiLSTM-CRF 进一步用神经网络自动提取上下文表示。六、总结HMM 要素NER 对应隐状态NER 标签序列BIO 编码的实体标签观测状态输入词序列句子中的每个词初始概率句首标签分布转移概率标签间转移编码 BIO 结构约束发射概率给定标签时词的概率推断算法Viterbi 算法求最优标签路径HMM 将 NER 建模为隐标签序列生成可观测词序列的过程隐状态是需要推断的实体标签观测状态是可直接看到的输入文本。其核心局限在于观测独立假设无法利用上下文词信息这也是后续 CRF 和深度学习方法成为主流的根本原因。

相关新闻

Taotoken API密钥管理与审计日志功能在实际项目中的使用体会

Taotoken API密钥管理与审计日志功能在实际项目中的使用体会

Taotoken API密钥管理与审计日志功能在实际项目中的使用体会 1. 引言 在多人协作的技术项目中,如何安全、可控地管理大模型API的调用权限,并能在出现问题时快速定位,是项目管理员面临的实际挑战。过去,我们常常面临一个困境&…

2026/7/25 15:30:24 阅读更多 →
【AI跨部门协作增效实战指南】:20年IT架构师亲授5大落地陷阱与3套可复用协同框架

【AI跨部门协作增效实战指南】:20年IT架构师亲授5大落地陷阱与3套可复用协同框架

更多请点击: https://codechina.net 第一章:AI跨部门协作增效的本质与战略价值 AI跨部门协作增效并非简单地将模型部署到多个业务线,而是通过统一的数据治理框架、共享的AI能力中台与可复用的服务接口,重构组织的知识流动路径与决…

2026/7/25 15:30:24 阅读更多 →
基于对比自监督学习的信号调制识别技术突破

基于对比自监督学习的信号调制识别技术突破

1. 项目背景与核心价值在无线通信和雷达信号处理领域,调制识别(Automatic Modulation Classification, AMC)一直是关键技术瓶颈。传统方法在低信噪比(SNR)环境下性能急剧下降,而国防科大最新提出的CSSL-AMC…

2026/7/25 15:29:23 阅读更多 →

最新新闻

CNN-LSTM混合神经网络在时间序列预测中的应用与优化

CNN-LSTM混合神经网络在时间序列预测中的应用与优化

1. 项目概述:当时间序列遇上混合神经网络在时间序列预测领域,传统单一模型往往难以兼顾空间特征提取和时间依赖性建模。这个项目构建了一个CNN-LSTM混合神经网络架构,并引入贝叶斯优化进行超参数自动调优。我在电力负荷预测项目中实测该模型&…

2026/7/25 15:42:30 阅读更多 →
League Akari:英雄联盟玩家的终极本地化工具箱完全指南

League Akari:英雄联盟玩家的终极本地化工具箱完全指南

League Akari:英雄联盟玩家的终极本地化工具箱完全指南 【免费下载链接】League-Toolkit An all-in-one toolkit for LeagueClient. Gathering power 🚀. 项目地址: https://gitcode.com/gh_mirrors/le/League-Toolkit League Akari 是一款基于英…

2026/7/25 15:42:30 阅读更多 →
将现有基于 OpenAI SDK 的项目迁移至 Taotoken 的实践路径

将现有基于 OpenAI SDK 的项目迁移至 Taotoken 的实践路径

将现有基于 OpenAI SDK 的项目迁移至 Taotoken 的实践路径 对于已经基于 OpenAI SDK 构建了成熟应用的开发者而言,直接对接单一模型服务商可能面临成本波动、服务稳定性或模型选择单一等挑战。Taotoken 作为一个提供 OpenAI 兼容 API 的大模型聚合分发平台&#xf…

2026/7/25 15:42:30 阅读更多 →
PHP伪协议深度解析:从文件包含到RCE的攻防实战

PHP伪协议深度解析:从文件包含到RCE的攻防实战

1. 项目概述:从CTFHub的一道题说起 最近在带新人过CTFHub的Web-RCE(远程代码执行)靶场时,发现很多朋友卡在了文件包含和伪协议利用这一关。题目本身并不复杂,一个典型的本地文件包含漏洞,但解题的关键在于如…

2026/7/25 15:42:29 阅读更多 →
AI生成3D打印模型:数学公式转STL文件实战指南

AI生成3D打印模型:数学公式转STL文件实战指南

这次我们来看一个结合了AI生成与3D打印技术的创新项目——Google 3.6 Flash模型。这个项目的核心价值在于能够通过AI算法直接生成可用于3D打印的数学艺术模型,特别是STL格式文件,让数学公式和几何结构转化为实体艺术品。从技术角度看,这个模型…

2026/7/25 15:42:29 阅读更多 →
如何为Nodejs后端服务配置Taotoken统一大模型调用接口

如何为Nodejs后端服务配置Taotoken统一大模型调用接口

如何为Nodejs后端服务配置Taotoken统一大模型调用接口 对于Node.js开发者而言,将大模型能力集成到后端服务中已成为常见需求。直接对接不同厂商的原生API往往意味着需要管理多个密钥、处理不同的调用格式,并在代码中维护复杂的切换逻辑。Taotoken平台提…

2026/7/25 15:41:29 阅读更多 →

日新闻

突破文档下载限制:kill-doc让你看到的都能保存

突破文档下载限制:kill-doc让你看到的都能保存

突破文档下载限制:kill-doc让你看到的都能保存 【免费下载链接】kill-doc 看到经常有小伙伴们需要下载一些免费文档,但是相关网站浏览体验不好各种广告,各种登录验证,需要很多步骤才能下载文档,该脚本就是为了解决您的…

2026/7/25 0:00:35 阅读更多 →
C++ string类模拟实现:从深拷贝到内存管理的完整指南

C++ string类模拟实现:从深拷贝到内存管理的完整指南

1. 项目概述:为什么我们要“手撕”string类?在C的学习道路上,尤其是从C语言过渡到C的“初阶”阶段,string类绝对是一个绕不开的核心。标准库里的std::string用起来太方便了,、find、substr,几个操作符和函数…

2026/7/25 0:00:35 阅读更多 →
三角洲寻宝鼠工具:高效文件搜索与资源管理实战指南

三角洲寻宝鼠工具:高效文件搜索与资源管理实战指南

1. 先搞清楚“三角洲寻宝鼠”到底是什么工具从名称来看,“三角洲寻宝鼠”更像是一个资源查找或文件检索类工具,而不是游戏或娱乐软件。这类工具的核心价值在于帮助用户快速定位特定资源,比如文档、图片、压缩包或特定格式的文件。如果你经常需…

2026/7/25 0:00:35 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/25 5:08:22 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/25 5:13:53 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/24 18:52:18 阅读更多 →

月新闻