词袋模型与 CountVectorizer:文本也可以做特征表
上一课我们讲了 TF-IDF。为了把 TF-IDF 理解得更扎实这一课先回到更基础的表示方法词袋模型。词袋模型听起来有点抽象其实它的想法很朴素不管词在句子里的顺序先统计每个词出现了多少次。什么是词袋模型词袋模型的英文是 Bag of Words。它把一段文本看成一个装满词的袋子只关心袋子里有哪些词、每个词出现了几次。例如两句话我 喜欢 机器学习 机器学习 很 有用如果词表是[我, 喜欢, 机器学习, 很, 有用]那么文档词袋向量我 喜欢 机器学习[1, 1, 1, 0, 0]机器学习 很 有用[0, 0, 1, 1, 1]每个文档变成等长向量长度等于词表大小每个位置的数字就是对应词在这段文本里的出现次数。这就把文本变成了数字。词袋模型丢掉了什么词袋模型有一个明显缺点它会丢掉顺序。我 不 喜欢 这个 功能 我 喜欢 这个 功能 不如果只统计词频两句话包含的词差不多但真实语义可能完全不同。所以词袋模型不是完美的语言理解方法它更像一个简单、稳定、容易解释的文本特征表。入门阶段先掌握它很有价值因为后面的 TF-IDF、文本分类 baseline、模型评估都会建立在这个基础上。CountVectorizer 做了什么在 sklearn 里CountVectorizer就是用来做词袋特征的工具。它主要做两件事从训练文本里建立词表把每条文本转换成词频向量。fromsklearn.feature_extraction.textimportCountVectorizer# 假设文本已经分好词、用空格隔开中文项目里这一步由 jieba 完成texts[我 喜欢 机器学习,机器学习 很 有用,这个 功能 不好用,]vectorizerCountVectorizer()Xvectorizer.fit_transform(texts)print(vectorizer.get_feature_names_out())# 词表print(X.toarray())# 词频矩阵每行一个文档每列一个词词频矩阵里每一行是一个文档每一列是一个词值是这个词在该文档里的出现次数。一个要注意的细节CountVectorizer默认的token_pattern会过滤掉单个字符。中文里我很这种单字词默认会被丢弃需要保留单字时可以设token_patternr(?u)\b\w\b或者在分词阶段就控制好词长。fit_transform 和 transform 的区别这个区别很重要X_train_vecvectorizer.fit_transform(X_train_text)X_test_vecvectorizer.transform(X_test_text)训练集用fit_transform因为要从训练集里学习词表。测试集只用transform因为测试集不能参与词表学习否则就会发生数据泄漏。这和前面讲过的标准化、Pipeline 是同一个原则训练阶段学到的规则测试阶段只能拿来用不能重新学。词表大小会影响模型如果训练文本很多词表可能非常大。词表越大矩阵列数越多模型训练也会更重。常用参数有参数作用建议max_features最多保留多少个词数据量大时必设否则特征爆炸min_df过滤出现太少的词中小数据集设 2过滤只出现 1 次的词max_df过滤出现太多的词0.7 ~ 0.9 之间太常见的词没区分力ngram_range加入连续词组合(1, 2)同时取单词和双词组合例如vectorizerCountVectorizer(max_features5000,min_df2,max_df0.9,ngram_range(1,2),)这表示最多保留 5000 个特征过滤太少见和太常见的词同时加入单词和连续两个词的组合。ngram 是什么ngram_range(1, 2)表示同时考虑 unigram 和 bigram。比如文本机器 学习 很 有用unigram 是机器 / 学习 / 很 / 有用bigram 是机器 学习 / 学习 很 / 很 有用加入 bigram 后模型有机会捕捉机器 学习这种连续搭配而不是只看到机器和学习两个分散的词。词袋和 TF-IDF 的关系词袋模型输出的是词频计数缺点也由此而来顺序丢失我不喜欢你和你不喜欢我的向量完全一样高频词霸权一个词出现 100 次未必比另一个词说一次更重要维度容易爆炸10 万篇文档乘 2 万词汇就是 2 亿维矩阵稀疏矩阵能处理但内存压力大。TF-IDF 可以看成在词频基础上进一步加权当前文本里重要、全局又有区分度的词权重更高。CountVectorizer数一数每个词出现几次 TfidfVectorizer在词频基础上考虑全局区分度两者都能用于文本分类。CountVectorizer 更直观TF-IDF 往往在很多文本分类任务里效果更好。这一课先记住词袋模型是文本特征工程的第一块积木。它会把文本变成样本数 × 词表大小的矩阵每一列代表一个词或词组每个值代表它在文本里的出现次数。max_features、min_df、max_df是控制维度的三件套丢失词序和高频词霸权是它的主要弱点下一步交给 TF-IDF 修正。下一课我们把 TF-IDF 和逻辑回归接起来训练一个真正可运行的中文文本分类 baseline。在线阅读点击这里阅读博客原文原文地址https://bestsdz.xyz/posts/countvectorizer-bag-of-words/

相关新闻

【AI大模型应用开发】【项目实战】24.RAG智慧问答项目-(十二)融合MySQL的RAG系统之基于 FastAPI 的 FAQ 与知识库查询接口

【AI大模型应用开发】【项目实战】24.RAG智慧问答项目-(十二)融合MySQL的RAG系统之基于 FastAPI 的 FAQ 与知识库查询接口

目标: 理解如何基于 FastAPI构建高效的问答系统 API 接口 掌握 WebSocket 流式输出和 HTTP 接口的实现,优化用户交互体验 前后端交互、前端静态文件服务以及日常问候处理的集成 一、开发完RAG系统以后,怎么对外提供服务? 对外: 调用链路: 前端 -> 后端 -> RAG系统 …

2026/7/24 4:29:17 阅读更多 →
Arduino Leonardo做的双旋钮+十四键音游控制器,即插即用支持多平台

Arduino Leonardo做的双旋钮+十四键音游控制器,即插即用支持多平台

本文还有配套的精品资源,点击获取 简介:用Arduino Leonardo打造的音乐游戏专用外设,自带两个带按压功能的高精度旋转编码器和十四颗独立按键,所有输入都可自由映射。设备通过标准HID协议通信,Windows/macOS/Linux系…

2026/7/24 7:28:17 阅读更多 →
基于SpringBoot的社区优选商城(Java+SpringBoot+MySQL)| 计算机毕业设计 附源码论文PPT

基于SpringBoot的社区优选商城(Java+SpringBoot+MySQL)| 计算机毕业设计 附源码论文PPT

本项目为计算机本科毕业设计,采用 Java Spring Boot 作为后端框架,Vue.js 作为前端框架,数据库使用 MySQL。系统涵盖用户管理、商家管理、商品管理、订单管理、客服聊天管理、论坛管理、商品资讯管理、购物车等八大功能模块。配套材料包括论…

2026/7/24 4:11:45 阅读更多 →

最新新闻

使用OpenAI库调用本地Ollama大模型API的实践指南

使用OpenAI库调用本地Ollama大模型API的实践指南

1. 项目概述在AI应用开发领域,如何高效调用各类大模型API是每个开发者必须掌握的技能。最近我发现一个非常实用的技巧:使用标准的openai库直接调用ollama本地部署的大模型服务。这种方法不仅兼容性优秀,还能让开发者用熟悉的openai接口操作本…

2026/7/24 8:10:42 阅读更多 →
VS Code 1.130更新 Agent架构大改 写代码的工具要管AI了

VS Code 1.130更新 Agent架构大改 写代码的工具要管AI了

VS Code 每个月一个版本号,说实话大部分时候的小更新普通开发者体感不强。但 1.130 这次有点意思——不是因为加了几个新特性,而是它的 Agent 架构开始走向成熟。Agent Host:从一个窗口到全局这次更新里最值得关注的不是侧边栏多了什么按钮&a…

2026/7/24 8:10:42 阅读更多 →
C++串口通信实战:从Windows API到工业级应用开发指南

C++串口通信实战:从Windows API到工业级应用开发指南

1. 项目概述:为什么串口通信依然是嵌入式与工控的基石在AI编程和高级框架满天飞的今天,你可能觉得像串口通信这种“古老”的技术已经过时了。但作为一名在工业自动化和嵌入式领域摸爬滚打多年的开发者,我可以很负责任地告诉你,RS-…

2026/7/24 8:10:42 阅读更多 →
GitHub Dependabot更新策略大变 三天冷却期能拦住供应链攻击吗

GitHub Dependabot更新策略大变 三天冷却期能拦住供应链攻击吗

做后端开发的应该对 Dependabot 不陌生。GitHub 的这个自动依赖更新机器人,之前一直挺勤快的——上游一发新版本,没几天就给你提个 PR。方便是真方便,但开源社区的生态攻击者也在利用这个机制。 怎么说呢——你越自动化的东西,被人…

2026/7/24 8:10:42 阅读更多 →
开源模型的授权困局 许可证正在成为新壁垒

开源模型的授权困局 许可证正在成为新壁垒

过去两年,开源大模型的数量增长惊人。从Llama到Mistral到DeepSeek到Qwen,几乎每个月都有新模型出来。看起来开源生态一片繁荣,但真正把模型下载下来想用的时候,很多人会遇到一个不太起眼但非常头疼的问题——许可证到底让不让我用…

2026/7/24 8:10:42 阅读更多 →
C++11 httplib库:轻量级HTTP服务器构建与RESTful API实战

C++11 httplib库:轻量级HTTP服务器构建与RESTful API实战

1. 项目概述:为什么选择C11与httplib? 在当今这个微服务、容器化和云原生大行其道的时代,动辄就是Nginx、Apache、Spring Boot这类重型框架,似乎构建一个HTTP服务器是一件非常“重量级”的事情。但很多时候,我们需要的…

2026/7/24 8:09:42 阅读更多 →

日新闻

用Highcharts 创建可拖拽三维散点立方体3D图表

用Highcharts 创建可拖拽三维散点立方体3D图表

该案例基于Highcharts scatter3d 三维散点图实现空间立方体散点可视化,核心特色:三维 X/Y/Z 三轴空间,所有散点分布在 0~10 立方体空间内;散点使用径向渐变实现立体 3D 圆球质感;支持鼠标 / 触屏拖拽画布,…

2026/7/24 0:00:29 阅读更多 →
AppCertDlls:进程创建路径上的 DLL 入口

AppCertDlls:进程创建路径上的 DLL 入口

AppCertDlls:进程创建路径上的 DLL 入口 AppCertDlls 位于 HKLM\System\CurrentControlSet\Control\Session Manager\AppCertDlls。本文的程序功能是只读列出这个键在 64 位和 32 位注册表视图中的全部值,并显示每条值的来源、名称、类型和可安全显示的数…

2026/7/24 0:00:29 阅读更多 →
我的编程之路:第一篇博客

我的编程之路:第一篇博客

大家好,我是一名编程初学者,同时这也是我编程学习之路上的第一篇博客。在这里,我想要向大家介绍我的一些想法和规划。a.自我介绍我是一个刚刚接触编程的新手,目前在学习c语言,我对编程世界充满了强烈的好奇。当然&…

2026/7/24 0:00:29 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/24 3:59:20 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/24 1:23:39 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/23 17:49:47 阅读更多 →

月新闻