【自然语言处理】微博评论情感分析——从数据预处理到词向量实战
微博评论情感分析从数据预处理到词向量构建简介一、项目介绍1. 项目任务2. 数据处理策略1核心目标2输入词向量格式3固定输入长度4超长评论处理5不足长度填充6词表压缩7未登录词处理二、代码实现1. 构建词表vocab_create.py词表构建逻辑说明2. 数据加载与预处理load_dataset.py数据格式说明3. 数据迭代器DatasetIteratorDatasetIterator 核心功能三、总结项目核心流程回顾关键技术要点简介在当今信息爆炸的时代海量的文本数据如社交媒体评论、产品评价、新闻留言等不断涌现这些文本中蕴含着人们丰富的情感态度——无论是对商品的喜爱、对政策的支持还是对服务的不满。自然语言处理NLP领域中的情感分析技术正是挖掘这些情感信息的关键工具。情感分析也常被称为意见挖掘它通过计算机技术对文本数据进行处理、分析和理解自动识别和提取文本中所包含的情感倾向如积极、消极、中性甚至还能进一步细分为喜悦、愤怒、悲伤、惊讶等具体的情感类别为企业决策、公共舆情监测、个人服务等诸多领域提供有力的支持。一、项目介绍1. 项目任务本项目旨在对微博评论信息进行情感分析建立模型自动识别评论所表达的情绪状态如积极、消极、中性等。2. 数据处理策略在深度学习的 NLP 任务中文本数据无法直接输入模型需要先将其转换为数值形式。以下是本项目中的核心处理策略1核心目标将每条评论内容转换为词向量形式作为模型的输入。2输入词向量格式每个词/字转换为200 维的词向量。本项目采用腾讯训练好的词向量模型原始维度为 4960 维如需该模型文件可私信获取。3固定输入长度每次传入模型的词/字个数需要固定。例如设定输入长度为 32则每条评论传入的数据格式为32 × 200的矩阵表示该批次 32 个词的向量表示。4超长评论处理如果一条评论超过 32 个词/字直接截断删除后面的内容。5不足长度填充如果一条评论不足 32 个词/字使用特殊标记PAD进行填充补齐到固定长度。6词表压缩语料库中的词/字数量庞大部分低频词难以训练出有效特征。因此项目中选择出现频率最高的4760 个词构建词表。7未登录词处理被压缩掉的低频词以及词表中不存在的词统一使用特殊标记UNK替代。二、代码实现1. 构建词表vocab_create.py本模块负责读取原始数据统计字符频率构建固定大小的词表并保存。fromtqdmimporttqdmimportpickleaspkl MAX_VOCAB_SIZE4760UNK,PADUNK,PADdefbuild_vocab(file_path,max_size,min_freq): 基于文本内容构建词表 参数 file_path: 数据文件路径 max_size: 词表最大容量 min_freq: 最小词频阈值 返回 vocab_dic: 词表字典 {字符: 索引} tokenizerlambdax:[yforyinx]# 分字函数vocab_dic{}withopen(file_path,r,encodingUTF-8)asf:i0forlineintqdm(f):# 跳过表头ifi0:i1continue# 提取评论内容跳过标签和逗号contentline[2:].strip()ifnotcontent:continue# 统计每个字符的出现频率forwordintokenizer(content):vocab_dic[word]vocab_dic.get(word,0)1# 按词频降序排列取前 max_size 个vocab_listsorted([itemforiteminvocab_dic.items()ifitem[1]min_freq],keylambdax:x[1],reverseTrue)[:max_size]# 构建词表字典vocab_dic{word:idxforidx,(word,_)inenumerate(vocab_list)}vocab_dic.update({UNK:len(vocab_dic),PAD:len(vocab_dic)1})# 保存词表pkl.dump(vocab_dic,open(simplifyweibo_4_moods.pkl,wb))print(f词表大小:{len(vocab_dic)})returnvocab_dicif__name____main__:vocabbuild_vocab(simplifyweibo_4_moods.csv,MAX_VOCAB_SIZE,1)print(词表构建完成)词表构建逻辑说明步骤说明1从 CSV 文件中读取中文评论文本2统计每个字符在语料中出现的次数3按词频降序排列保留前 4760 个高频字符4为每个字符分配唯一索引0~47595添加UNK索引 4760和PAD索引 47616将词表序列化保存为 .pkl 文件2. 数据加载与预处理load_dataset.py本模块负责读取数据、进行填充/截断、划分数据集。fromtqdmimporttqdmimportpickleaspklimportrandomimporttorch UNK,PADUNK,PADdefload_dataset(path,pad_size70): 加载数据集并进行预处理 参数 path: 数据文件路径 pad_size: 固定序列长度 返回 vocab: 词表字典 train_data: 训练集 dev_data: 验证集 test_data: 测试集 contents[]vocabpkl.load(open(simplifyweibo_4_moods.pkl,rb))tokenizerlambdax:[yforyinx]withopen(path,r,encodingutf8)asf:i0forlineintqdm(f):# 跳过表头ifi0:i1continueifnotline:continue# 提取标签和评论内容labelint(line[0])contentline[2:].strip(\n)# 分字tokentokenizer(content)seq_lenlen(token)# 填充或截断到 pad_sizeifpad_size:iflen(token)pad_size:token.extend([PAD]*(pad_size-len(token)))else:tokentoken[:pad_size]seq_lenpad_size# 字符转索引words_line[vocab.get(word,vocab.get(UNK))forwordintoken]contents.append((words_line,label,seq_len))# 随机打乱random.shuffle(contents)# 按 8:1:1 划分训练集、验证集、测试集totallen(contents)train_datacontents[:int(total*0.8)]dev_datacontents[int(total*0.8):int(total*0.9)]test_datacontents[int(total*0.9):]returnvocab,train_data,dev_data,test_dataif__name____main__:vocab,train_data,dev_data,test_dataload_dataset(simplifyweibo_4_moods.csv)print(f训练集:{len(train_data)}条)print(f验证集:{len(dev_data)}条)print(f测试集:{len(test_data)}条)数据格式说明处理后的每条数据是一个三元组字段类型说明words_linelist[int]字符索引列表长度为 pad_sizelabelint情感标签0/1/2等seq_lenint填充前的实际长度3. 数据迭代器DatasetIterator本模块负责将数据按批次打包转换为 PyTorch Tensor并支持迭代访问。classDatasetIterator:数据集迭代器批次化处理 Tensor 转换def__init__(self,batches,batch_size,device):self.batch_sizebatch_size self.batchesbatches self.n_batcheslen(batches)//batch_size self.residuelen(batches)%batch_size!0self.index0self.devicedevicedef_to_tensor(self,datas):将批次数据转换为 Tensorxtorch.LongTensor([_[0]for_indatas]).to(self.device)ytorch.LongTensor([_[1]for_indatas]).to(self.device)seq_lentorch.LongTensor([_[2]for_indatas]).to(self.device)return(x,seq_len),ydef__next__(self):迭代下一批次# 处理剩余样本ifself.residueandself.indexself.n_batches:batchesself.batches[self.index*self.batch_size:len(self.batches)]self.index1returnself._to_tensor(batches)# 迭代结束ifself.indexself.n_batches:self.index0raiseStopIteration# 正常批次startself.index*self.batch_size end(self.index1)*self.batch_size batchesself.batches[start:end]self.index1returnself._to_tensor(batches)def__iter__(self):returnselfdef__len__(self):returnself.n_batches(1ifself.residueelse0)DatasetIterator 核心功能功能说明批次化处理将数据分批加载避免内存溢出自动转换 Tensor将 Python 数据转为 PyTorch Tensor设备兼容自动将数据分配到 CPU 或 GPU标准迭代接口支持 for 循环和 len() 操作三、总结项目核心流程回顾词表构建统计语料字符频率 → 筛选高频词 → 分配索引 → 保存词表数据预处理读取文本 → 分字 → 填充/截断 → 转索引 → 划分数据集批次迭代按批次加载数据 → 转 Tensor → 供模型训练使用关键技术要点固定输入长度是 NLP 模型训练的基本要求用于填充不足部分 用于处理未登录词词表压缩可减少模型参数量提升训练效率数据集迭代器是连接预处理和模型训练的关键桥梁

相关新闻

计算机体系结构核心:机器字长、存储字长与指令字长深度解析

计算机体系结构核心:机器字长、存储字长与指令字长深度解析

1. 从“字长”说起:计算机底层设计的基石干了这么多年硬件和底层软件,我发现很多朋友在入门计算机体系结构时,对“字长”这个概念总是一知半解。机器字长、存储字长、指令字长,这三个词听起来很像,但它们在CPU设计、内…

2026/7/31 4:01:50 阅读更多 →
MyBatis动态SQL中安全处理List参数:避免IN查询的null与空集合陷阱

MyBatis动态SQL中安全处理List参数:避免IN查询的null与空集合陷阱

1. 从一次“诡异”的查询说起&#xff1a;为什么list.contains在 MyBatis 里不是你想的那样那天下午&#xff0c;我正对着一个看似简单的需求挠头。后端接口接收一个用户ID列表List<Long> userIds&#xff0c;需要从数据库里查询出所有在这个列表中的用户信息。这太常见了…

2026/7/31 4:01:50 阅读更多 →
haporxy概述,实验环境设定,haproxy安装及配置参数,socat日更新工具、基于cookie的会话保持

haporxy概述,实验环境设定,haproxy安装及配置参数,socat日更新工具、基于cookie的会话保持

haproxy概述什么是 HAProxyHAProxy 全称 High Availability Proxy&#xff0c;是一款免费、开源、高性能的 TCP/HTTP 反向代理、负载均衡软件&#xff0c;使用 C 语言开发。支持 四层&#xff08;TCP&#xff09;负载均衡 七层&#xff08;HTTP/HTTPS&#xff09;负载均衡跨平…

2026/7/31 4:01:50 阅读更多 →

最新新闻

Spring Boot 应用对接 Prometheus 监控指南

Spring Boot 应用对接 Prometheus 监控指南

Spring Boot 应用对接 Prometheus 监控指南 本文档介绍如何将 Spring Boot 应用接入 Prometheus 监控体系&#xff0c;分无认证和 Basic Auth 认证两种情况说明。一、技术栈组件用途Micrometer指标采集门面Spring Boot Actuator暴露监控端点Prometheus指标采集 时序数据库Graf…

2026/7/31 5:53:52 阅读更多 →
hubuild中的uniapp项目运行在Android Studio平板模拟器中

hubuild中的uniapp项目运行在Android Studio平板模拟器中

1.下载Android Studio2.打开设备管理器打开后如图打开后这个列表是空的&#xff0c;我的是已经添加了&#xff0c;点击左上角加号&#xff0c;左侧选择Tablet&#xff0c;就是平板的意思&#xff0c;右侧随便选一个&#xff0c;第三个是我自己自定义添加的&#xff0c;是点击左…

2026/7/31 5:53:52 阅读更多 →
C语言基础:字符数组

C语言基础:字符数组

一维字符数组应用 &#xff1a; 存储字符串。1.定义&#xff1a;类型 数组名[整形常量]; 整形常量 数组的容量&#xff0c;表示可以储存多少个字符 类型 char c语言规定&#xff0c;字符串必须使用\0 作为结束标准。 如果你要在数组中储存一个 hello , hello\0 共计6个…

2026/7/31 5:53:52 阅读更多 →
GEO优化哪个机构靠谱

GEO优化哪个机构靠谱

在选择 GEO 优化机构时&#xff0c;以下几个方面可以帮助你判断其是否靠谱&#xff1a;机构的背景和资质成立时间&#xff1a;成立时间较长的机构通常在行业内积累了更多的经验和资源。例如合肥拓路人信息科技有限公司&#xff0c;2016 年 4 月成立&#xff0c;十年的时间里专注…

2026/7/31 5:53:52 阅读更多 →
练习实验之----NAT

练习实验之----NAT

本实验包含源NAT、NAT Server、双向NAT方式实验拓扑需求1、client1(移动用户)访问web-server通过Fw的GE1/0/1接口访问 2、client3(电信用户)访问web-server通过Fw的GE1/0/2接口访问 3、内网用户即可以通过域名访问web-server&#xff0c;也可以通过私网IP访问 4、web-server设备…

2026/7/31 5:53:52 阅读更多 →
Java内存溢出全解析:从JVM内存模型到实战排查与优化

Java内存溢出全解析:从JVM内存模型到实战排查与优化

1. 项目概述&#xff1a;从“内存溢出”告警到问题根因定位如果你写过Java程序&#xff0c;大概率在某个深夜被控制台突然蹦出的OutOfMemoryError或者StackOverflowError搞得头皮发麻。这不仅仅是新手才会遇到的麻烦&#xff0c;随着系统复杂度提升、数据量激增&#xff0c;即便…

2026/7/31 5:52:52 阅读更多 →

日新闻

物理复制比逻辑复制好在哪?数据库复制原理详解

物理复制比逻辑复制好在哪?数据库复制原理详解

数据库复制是把主库数据同步到备库的机制&#xff0c;分为逻辑复制和物理复制两种。逻辑复制传输的是 SQL 语句或行变更事件&#xff0c;物理复制传输的是存储引擎底层的物理日志。阿里云 PolarDB&#xff08;云原生数据库&#xff09;采用物理复制&#xff0c;在同步延迟、数据…

2026/7/31 0:00:34 阅读更多 →
BilibiliDown:3分钟学会B站视频下载的终极指南

BilibiliDown:3分钟学会B站视频下载的终极指南

BilibiliDown&#xff1a;3分钟学会B站视频下载的终极指南 【免费下载链接】BilibiliDown (GUI-多平台支持) B站 哔哩哔哩 视频下载器。支持稍后再看、收藏夹、UP主视频批量下载|Bilibili Video Downloader &#x1f633; 项目地址: https://gitcode.com/gh_mirrors/bi/Bilib…

2026/7/31 0:00:34 阅读更多 →
有哪些游戏数据AI平台?游戏行业Data+AI融合方案盘点

有哪些游戏数据AI平台?游戏行业Data+AI融合方案盘点

当前&#xff0c;游戏行业的“DataAI融合”已从概念验证进入价值落地阶段。根据IDC 2025年数据&#xff0c;中国AI游戏云市场规模已达18.6亿元&#xff1b;同时&#xff0c;游戏研发环节AI渗透率高达86%&#xff0c;生成式AI内容普及率超过50%。面对庞大的市场&#xff0c;游戏…

2026/7/31 0:00:34 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档&#xff0c;可以直接使用&#xff01;系统支持图片、视频、摄像头等多种方式检测裂缝&#xff0c;功能强大实用。 1数据集6000张 8各类别

2026/7/31 1:03:03 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像&#xff01; pubg绝地求生目标检测数据集 1分类&#xff1a;e_body&#xff0c;14905个标签&#xff0c;txt格式 共计14244张图&#xff0c;99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/29 14:34:28 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别&#xff1a; allies enemy tag图片总量&#xff1a;7247张训练集&#xff1a;5139张验证集&#xff1a;1425张测试集&#xff1a;683张标注状态&#xff1a;全部已标注&#xff0c;即拿即用数据格式&#xff1a;支持YOLO格式及其他格式&#…

2026/7/31 4:19:39 阅读更多 →

月新闻