大模型学习12 - nlp自然语言处理2 -文本表示
1 概述文本表示是将自然语言转化为计算机能够理解的数值形式是绝大多数自然语言处理NLP任务的基础步骤。早期的文本表示方法如词袋模型通常将整段文本编码为一个向量。这类方法实现简单、计算高效但存在明显的局限性——表达语序和上下文语义的能力较弱。因此现代 NLP 技术逐渐引入更加精细和表达力更强的文本表示方法以更有效地建模语言的结构和含义。文本表示的第一步通常是分词和词表构建如下图所示分词Tokenization是将原始文本切分为若干具有独立语义的最小单元即token的过程是所有 NLP 任务的起点。词表Vocabulary是由语料库构建出的、包含模型可识别 token 的集合。词表中每个token都分配有唯一的 ID并支持 token 与 ID 之间的双向映射。在后续训练或预测过程中模型会首先对输入文本进行分词再通过词表将每个 token 映射为其对应的 ID。接着这些 ID 会被输入嵌入层Embedding Layer转换为低维稠密的向量表示即词向量如下图所示。此外在文本生成任务中模型的输出层会针对词表中的每个 token 生成一个概率分布表示其作为下一个词的可能性。系统通常选取具有最大概率的ID并通过词表查找对应的 token从而逐步生成最终的输出文本。2 分词不同语言由于语言结构、词边界的差异其分词策略和算法也不尽相同本节将分别介绍英文与中文中常见的分词方式。2.1 英文分词按照分词粒度的大小可分为词级Word-Level分词、字符级Character-Level分词和子词级Subword‑Level分词。下面逐一介绍。2.1.1 词级分词词级分词是指将文本按词语进行切分是最传统、最直观的分词方式。在英文中空格和标点往往是天然的分隔符。词级分词虽便于理解和实现但在实际应用中容易出现 OOVOut-Of-Vocabulary未登录词问题。所谓 OOV是指在模型使用阶段输入文本中出现了不在预先构建词表中的词语常见的包括网络热词、专有名词、复合词及拼写变体等。由于模型无法识别这些词通常会将其统一替换为特殊标记如 从而导致语义信息的丢失影响模型的理解与预测能力。2.1.2 字符级分词字符级分词Character-level Tokenization是以单个字符为最小单位进行分词的方法文本中的每一个字母、数字、标点甚至空格都会被视作一个独立的 token。在这种分词方式下词表仅由所有可能出现的字符组成因此词表规模非常小覆盖率极高几乎不存在 OOVOut-of-Vocabulary问题。无论输入中出现什么样的新词或拼写变体只要字符在词表中都能被表示出来。然而由于单个字符本身语义信息极弱模型必须依赖更长的上下文来推断词义和结构这显著增加了建模难度和训练成本。此外输入序列也会变得更长影响模型效率。2.1.3 子词级分词子词级分词是一种介于词级分词与字符级分词之间的分词方法它将词语切分为更小的单元——子词subword例如词根、前缀、后缀或常见词片段。与词级分词相比子词分词可以显著缓解OOV问题与字符级分词相比它能更好地保留一定的语义结构。子词分词的基本思想是即使一个完整的词没有出现在词表中只要它可以被拆分为词表中存在的子词单元就可以被模型识别和表示从而避免整体被替换为。常见的子词分词算法包括 BPEByte Pair Encoding、WordPiece 和 Unigram Language Model。其中BPE是最早被广泛应用的子词分词方法。其基本思想是在训练阶段首先将语料中的词汇拆分为单个字符构建初始词表然后迭代地统计语料中出现频率最高的相邻字符对将其合并为新的子词单元并加入词表。这个过程持续进行直到词表大小达到预设上限。在分词阶段BPE 会根据构建好的词表和合并规则对新输入的文本进行处理。具体做法是将文本拆分为最小单位如字符或字节然后按顺序应用训练中学习到的合并规则逐步合并直到无法继续。最终得到的就是由子词组成的分词结果。详细的实现过程可参考Hugging Face提供的一篇优秀教程。示例:子词级分词已经成为现代英文 NLP 模型中的主流方法如 BERT、GPT等模型均采用了基于子词的分词机制。2.2 中文分词尽管中文的语言结构与英文存在显著差异我们仍可以借助“分词粒度”的视角对中文的分词方式进行归类和分析。2.2.1字符级分词字符级分词是中文处理中最简单的一种方式即将文本按照单个汉字进行切分文本中的每一个汉字都被视为一个独立的 token。由于汉字本身通常具有独立语义因此字符级分词在中文中具备天然的可行性。相比英文中的字符分词中文的字符分词更加“语义友好”。2.2.2 词级分词词级分词是将中文文本按照完整词语进行切分的传统方法切分结果更贴近人类阅读习惯。由于中文没有空格等天然词边界词级分词通常依赖词典、规则或模型来识别词语边界。但是当采集到的数据集内容不规范时,比如商品的评论,可能还是会出现把空格当标点的情况.需要再分词的时候进行清洗:# 1. 加载数据dfpd.read_csv(data/online_shopping_10_cats.csv)# 2. 数据清洗df.dropna(inplaceTrue)# 3. 分词准备语料sentences[[tokenfortokeninjieba.lcut(sentence)iftoken.strip()!]forsentenceindf[review]]2.2.3子词级分词虽然中文没有英文中的子词结构如前缀、后缀、词根等但子词分词算法如 BPE仍可直接应用于中文。它们以汉字为基本单位通过学习语料中高频的字组合如“自然”、“语言”、“处理”自动构建子词词表。这种方式无需人工词典具有较强的适应能力。在当前主流的中文大模型如通义千问、DeepSeek中子词分词已成为广泛采用的文本切分策略。2.3 分词工具2.3.1 概述目前市面上可用于中文分词的工具种类繁多按照实现方式大致可以分为如下两类一类是基于词典或模型的传统方法主要以“词”为单位进行切分另一类是基于子词建模算法如BPE的方式从数据中自动学习高频字组合构建子词词表。前者的代表工具包括 jieba、HanLP等这些工具广泛应用于传统 NLP 任务中。后者的代表工具包括 Hugging Face Tokenizer、SentencePiece、tiktoken等常用于大规模预训练语言模型中。2.3.2 jieba分词器2.3.2.1概述jieba 是中文分词领域中应用广泛的开源工具之一具有接口简洁、模式灵活、词典可扩展等特点在各类传统 NLP 任务中依然具备良好的实用价值。2.3.2.2安装pip install jieba2.3.2.3分词模式jieba分词器提供了多种分词模式以适应不同的应用场景。1精确模式默认试图将句子最精确地切开适合文本分析。分词效果如下小明毕业于北京大学计算机系 ⬇️ [小明|毕业|于|北京大学|计算机系]精确模式分词可使用 jieba.cut 或者 jieba.lcut 方法前者返回一个生成器对象后者返回一个list。具体代码如下importjieba text小明毕业于北京大学计算机系words_generatorjieba.cut(text)# 返回一个生成器forwordinwords_generator:print(word)words_listjieba.lcut(text)# 返回一个列表print(words_list)运行结果 :2全模式把句子中所有的可以成词的词语都扫描出来分词效果如下小明毕业于北京大学计算机系 ⬇️ [小|明|毕业|于|北京|北京大学|大学|计算|计算机|计算机系|算机|系]全模式分词可使用jieba.cut或者jieba.lcut并将cut_all参数设置为True具体代码如下importjieba text小明毕业于北京大学计算机系words_generatorjieba.cut(text,cut_allTrue)# 返回一个生成器forwordinwords_generator:print(word)words_listjieba.lcut(text,cut_allTrue)# 返回一个列表print(words_list)运行结果 :3搜索引擎模式在精确模式基础上对长词进一步切分适合用于搜索引擎分词分词效果如下小明毕业于北京大学计算机系 ⬇️ [小明|毕业|于|北京|大学|北京大学|计算|算机|计算机|计算机系]可使用 jieba.cut_for_search 或者 jieba.lcut_for_search具体代码如下importjieba text小明毕业于北京大学计算机系words_generatorjieba.cut_for_search(text)# 返回一个生成器forwordinwords_generator:print(word)words_listjieba.lcut_for_search(text)# 返回一个列表print(words_list)运行结果:4自定义词典jieba支持用户自定义词典以便包含 jieba 词库里没有的词用于增强特定领域词汇的识别能力。自定义词典的格式为一个词占一行每一行分三部分词语、词频可省略词频决定某个词在分词时的优先级。词频越高被优先切分出来的概率越大、词性标签可省略不影响分词结果用空格隔开顺序不可颠倒。例如云计算 云原生 5 大模型 10 n可使用jieba.load_userdict(file_name)加载词典文件也可以使用jieba.add_word(word, freqNone, tagNone)与jieba.del_word(word)动态修改词典。importjieba jieba.load_userdict(dict.txt)words_listjieba.lcut(随着云计算技术的普及越来越多企业开始采用云原生架构来部署服务并借助大模型能力提升智能化水平实现业务流程的自动化与智能决策。)print(words_list)运行结果 :3 词表示3.1 概述在分词完成之后文本被转换为一系列的 token词、子词或字符。然而这些符号本身对计算机而言是不可计算的。因此为了让模型能够理解和处理文本必须将这些 token 转换为计算机可以识别和操作的数值形式这一步就是所谓的词表示word representation。词表示的发展经历了从稀疏的one-hot编码到稠密的语义化词向量再到近年来的上下文相关的词表示。不同的词表示方法在表达能力、语义建模、上下文适应性等方面存在显著差异。3.2 One-hot 编码最早期的词向量表示方式是 One-hot 编码它将词汇表中的每个词映射为一个稀疏向量向量的长度等于整个词表的大小。该词在对应的位置为 1其他位置为 0。one-hot 虽然实现简单、直观易懂但它无法体现词与词之间的语义关系且随着词表规模的扩大向量维度会迅速膨胀导致计算效率低下。因此在实际自然语言处理任务中one-hot 表示已经很少被直接使用。3.3 语义化词向量传统的one-hot表示虽然结构简单但它无法反映词语之间的语义关系也无法衡量词与词之间的相似度。为了解决这个问题研究者提出了Word2Vec模型它通过对大规模语料的学习为每个词生成一个具有语义意义的稠密向量表示。这些向量能够在连续空间中表达词与词之间的关系使得“意思相近”的词在空间中距离更近。3.3.1 Word2Vec 概述Word2Vec的设计理念源自“分布假设”——即一个词的含义由它周围的词决定。基于这一假设Word2Vec构建了一个简洁的神经网络模型通过学习词与上下文之间的关系自动为每个词生成一个能够反映语义特征的向量表示。Word2Vec提供了两种典型的模型结构用于实现对词向量的学习CBOWContinuous Bag-of-Words模型输入是一个词的上下文即前后若干个词模型的目标是预测中间的目标词。Skip-gram 模型输入是一个中心词模型的目标是预测其上下文中的所有词即前后若干个词。只要按照上述目标训练模型就能得到语义化的词向量。3.3.2 Word2Vec 原理3.3.2.1数据集Word2Vec 不依赖人工标注而是直接利用大规模原始文本如书籍、新闻、网页等作为数据源从中自动构造训练样本。由于两种模型的输入和输出都是词语因此首先需要对原始文本进行分词将连续文本转换为 token 序列。此外模型无法直接处理文本符号训练时仍需将词语转换为 one-hot 编码以便作为模型的输入和输出进行计算。3.3.2.2Skip-Gram1训练数据集Skip-Gram的目标是根据中间词预测上下文所以其训练样本为2模型结构Skip-Gram模型结构如下图所示Skip-Gram模型损失值的计算图如下图所示前向传播过程如下1.输入中心词地铁“地铁”用 one-hot 向量表示2.查找词向量Win与参数矩阵Win相乘取出“地铁”对应的词向量。Win实际上就是词向量矩阵每一行表示一个词的向量3.预测上下文将中心词向量与参数矩阵 Wout相乘得到对整个词表的预测得分。4.Softmax 输出得分通过 Softmax 转为概率分布表示各词作为上下文的可能性。5.计算损失与真实上下文词“乘坐”、“上班”进行比对计算交叉熵损失并求和得到总损失。之后在进行反向传播时参数矩阵Win中的“地铁”对应的词向量就会被更新模型通过这个过程不断的进行学习最终便能得到具有语义的词向量。3.3.2.3CBOW1训练样本CBOW的目标是根据上下文预测中间词所以其训练样本为2模型结构CBOW模型的结构如下图所示CBOW模型损失值的计算图如下图所示CBOW 模型的前向传播过程如下1.输入上下文词乘坐、上班每个词用 one-hot 向量表示。2.查找词向量Win每个 one-hot 向量与参数矩阵 Win 相乘查出对应的词向量。Win 实际上就是词向量矩阵每一行表示一个词的向量3.平均上下文向量将多个上下文词向量取平均得到一个整体的上下文表示。4.预测中心词将平均后的上下文向量与参数矩阵Wout相乘得到对整个词表的预测得分。5.Softmax 输出将得分输入Softmax得到每个词作为中心词的概率分布。6.计算损失将预测结果与真实中心词“地铁”的one-hot向量进行比对计算交叉熵损失。之后在进行反向传播时参数矩阵Win中“乘坐”和“上班”对应的词向量就会被更新。模型通过不断训练逐步优化这些向量最终便能得到具有语义的词向量。3.3.3 获取Word2Vec词向量词向量的获取通常有两种方式一种是直接使用他人公开发布的词向量另一种是在特定语料上自行训练。在实际工作中无论是加载已有模型还是从零训练都可借助Gensim来完成它提供了便捷的接口来加载 Word2Vec 格式的词向量也支持基于自有语料训练属于自己的词向量模型。可执行以下命令安装Gensimpip install gensim3.3.3.1使用公开词向量公开的中文词向量可从https://github.com/Embedding/Chinese-Word-Vectors下载其提供了基于多个数据集训练得到的词向量。词向量文件的格式为第一行记录基本信息包括两个整数分别表示总词数和词向量维度。从第二行起每一行表示一个词及其对应的词向量格式为词 向量的各个维度值。所有内容通过空格分隔该格式已成为自然语言处理领域中广泛接受的约定俗成的通用格式。具体格式如下词汇总数 向量维度 word1 val11 val12 ... val1N word2 val21 val22 ... val2N ...可使用KeyedVectors.load_word2vec_format()加载上述词向量文件具体代码如下。fromgensim.modelsimportKeyedVectors model_pathsgns.weibo.word.bz2modelKeyedVectors.load_word2vec_format(model_path)上述代码使用的sgns.weibo.word.bz2词向量文件包含195202个词每个词向量300维。该文件可从该网址下载也可直接从课程资料获取。词向量加载完后便可使用如下API查询词向量查看词向量维度print(model.vector_size)查看某个词的向量print(model[地铁])查看两个向量的相似度similaritymodel.similarity(地铁,公交)print(地铁 vs 公交 相似度,similarity)model.similarity 计算的是两个词向量的余弦相似度计算公式如下返回值介于[-1,1]。接近1表示高度相似语义接近接近0表示无明显相关接近-1方向完全相反极度不相似。-1不代表是反义词,反义词更像每个节点相似,一个相反找出与某个词最相似的词similar_wordsmodel.most_similar(positive[上班],topn5)print(similar_words)resultmodel.most_similar(positive[爸爸,女性],negative[男性],topn3)print(result)3.3.3.2自行训练词向量1准备语料Word2Vec 的训练语料需要是已分词的文本序列格式为sentences[[我,每天,乘坐,地铁,上班],[我,每天,乘坐,公交,上班]]2训练模型gensim提供了十分方便的训练词向量的API——Word2Vec。fromgensim.modelsimportWord2Vec modelWord2Vec(sentences,# 已分词的句子序列vector_size100,# 词向量维度window5,# 上下文窗口大小min_count2,# 最小词频低于将被忽略sg1,# 1:Skip-Gram0:CBOWworkers4# 并行训练线程数)3保存词向量model.wv.save_word2vec_format(my_vectors.kv)4加载词向量fromgensim.modelsimportKeyedVectors my_modelKeyedVectors.load_word2vec_format(my_vectors.kv)完整案例如下数据集来源为ChineseNLPCorpus格式CSV具体结构如下完整代码如下importjiebafromgensim.modelsimportWord2Vec,KeyedVectorsimportpandasaspd dfpd.read_csv(online_shopping_10_cats.csv,encodingutf-8,usecols[review])sentences[[tokenfortokeninjieba.lcut(review)iftoken.strip()!]forreviewindf[review]]modelWord2Vec(sentences,# 已分词的句子序列vector_size100,# 词向量维度window5,# 上下文窗口大小min_count2,# 最小词频低于将被忽略sg1,# 1 Skip-Gram0 CBOWworkers4# 并行训练线程数)model.wv.save_word2vec_format(my_vectors.kv)my_modelKeyedVectors.load_word2vec_format(my_vectors.kv)print(my_model)3.3.4 应用Word2Vec词向量训练好的词向量通常用于初始化下游NLP任务的嵌入层。在现代深度学习的 NLP 模型中大多数任务的输入第一层都是嵌入层。本质上嵌入层就是一个查找表lookup table输入是词在词汇表中的索引输出是该词对应的向量表示。嵌入层的参数矩阵可以有两种典型的初始化方式随机初始化模型训练开始时嵌入向量是随机生成的模型会通过反向传播逐步学习每个词的表示。使用预训练词向量初始化加载训练好的词向量如 Word2Vec到嵌入层中作为初始参数这样可以为模型注入丰富的语言知识尤其在低资源任务中优势明显。并且加载预训练词向量后可选择是否让嵌入层继续参与训练。下面以PyTorch为例演示如何使用预训练词向量初始化Embedding层核心API为nn.Embedding.from_pretrainedembedding_layernn.Embedding.from_pretrained(embedding_matrix,# 词向量矩阵形状为(num_embeddigns,embedding_dim)freezeFalse# 是否冻结词向量)以下是完整案例importtorchimporttorch.nnasnnfromgensim.modelsimportKeyedVectors# 1. 加载预训练的 Word2Vec 模型word_vectorsKeyedVectors.load_word2vec_format(my_vectors.kv)# 2. 构建词表和词向量矩阵word2indexword_vectors.key_to_index# 词到索引的映射embedding_dimword_vectors.vector_size# 词语向量维度num_embeddingslen(word2index)# 词表大小embedding_matrixtorch.zeros(num_embeddings,embedding_dim)# 构造词向量矩阵,形状为(词表大小,词向量维度大小)forword,idxinword2index.items():embedding_matrix[idx]torch.tensor(word_vectors[word])# 3. 构建 PyTorch 的嵌入层embedding_layernn.Embedding.from_pretrained(embedding_matrix,# 词向量矩阵形状为(num_embeddigns,embedding_dim)freezeFalse# 是否冻结词向量)# 4. 示例将词索引转换为向量input_words[我,喜欢,乘坐,地铁]# 分词后的句子input_indices[word2index[word]forwordininput_words]# token转为索引input_tensortorch.tensor([input_indices])# 构造嵌入层输入张量# 5. 查询嵌入即词向量查找outputembedding_layer(input_tensor)# 通过嵌入层查找预训练词向量print(output.shape)# 例如 torch.Size([1, 4, 100])3.4上下文相关词表示虽然像Word2Vec这样的模型已经能够为词语提供具有语义的向量表示但是它只为每个词分配一个固定的向量表示不论它在句中出现的语境如何。这种表示被称为静态词向量static embeddings。然而语言的表达极其灵活一个词在不同上下文中可能有完全不同的含义。例如这时使用同一个静态词向量去表示“苹果”显然无法区分这两种语义。这就推动了上下文相关的词表示的发展。上下文相关词表示Contextual Word Representations是指词语的向量表示会根据它所在的句子上下文动态变化从而更好地捕捉其语义。一个具有代表性的模型是——ELMo。该模型全称为 Embeddings from Language Models发表于2018年2月。其基于LSTM RNN的一种改进版本语言模型使用上下文动态生成每个词的表示每个词的向量由其前文和后文共同决定是第一个被广泛应用于下游任务的上下文词向量模型。

相关新闻

220kV电网潮流计算与继电保护配置:毕设避坑与工程实践指南

220kV电网潮流计算与继电保护配置:毕设避坑与工程实践指南

简介:这份毕业设计文档面向电力系统及其自动化专业的本科生与继电保护方向学习者,围绕某220kV电网的潮流计算与输电线路继电保护配置展开,可用于课程设计参考、答辩准备及工程计算思路梳理。资源包内含1个doc文件,约1.43MB&#x…

2026/10/10 12:27:03 阅读更多 →
连接表证明器与模仿学习:从专家轨迹学习叶子与连接选择策略

连接表证明器与模仿学习:从专家轨迹学习叶子与连接选择策略

自动定理证明(ATP)在很长一段时间里是符号推理的专属领域:归结、Tableau、SMT 抽象,方法很多,但核心思路都建立在“把逻辑问题变成语法规约下的搜索问题”上。最近几年神经符号结合的方法越来越多,可大多数…

2026/10/10 12:27:03 阅读更多 →
旅游网站数据分析与可视化:从数据清洗到交互看板的完整实战

旅游网站数据分析与可视化:从数据清洗到交互看板的完整实战

简介:这是一份面向高校学生与Python初学者的旅游网站数据分析与可视化期末大作业完整源码包,评审得分95分以上,经过严格调试可直接运行,适合作为课程设计参考、数据分析入门练手或可视化项目模板。压缩包共74个文件,约…

2026/10/10 12:27:03 阅读更多 →

最新新闻

STM32F423RH与PJ85718DM的HVAC温度监测方案

STM32F423RH与PJ85718DM的HVAC温度监测方案

1. 项目背景与核心需求拆解温度监测这件事,看起来简单,真要做到“本地能看、远程能查、长期稳定”,里面门道不少。我最近在做一个嵌入式和 HVAC(暖通空调)场景下的温度采集方案,主控用的是 STM32F423RH&…

2026/10/10 14:06:48 阅读更多 →
基于PJ85718DM与PIC18F87J11的本地及远程温度监测方案

基于PJ85718DM与PIC18F87J11的本地及远程温度监测方案

1. 从一颗传感器和一颗MCU说起:这个温度监测方案到底在解决什么问题嵌入式温度监测听起来像是老生常谈,但真正落到HVAC(暖通空调)场景里,事情远没有想象中那么简单。我接触过不少做楼宇自控和机房环境监控的项目&#…

2026/10/10 14:06:48 阅读更多 →
C++实现可调试的DFA词法分析器与LALR1语法分析器

C++实现可调试的DFA词法分析器与LALR1语法分析器

简介:本资源是一份面向计算机专业本科生与编译原理初学者的完整课程设计实践包,聚焦词法与语法分析两大核心编译阶段,提供可运行、可调试、可复现的C工程实现。资源包含17个文件,总计2.48MB,涵盖3个关键头文件&#xf…

2026/10/10 14:06:48 阅读更多 →
产线数据采集上位机选型与运维:IPC-510 4U工控机实战解析

产线数据采集上位机选型与运维:IPC-510 4U工控机实战解析

两年前接了一个产线改造项目,甲方主管反复强调一句话:监控电脑可以慢,但不能死;数据可以后补,但绝对不能丢。那时候我在选型表里列了三个方案:普通商用台式机、无风扇嵌入式工控箱、还有一台研华 IPC-510 这…

2026/10/10 14:06:48 阅读更多 →
通达信公式编写核心原理与四大类型避坑指南

通达信公式编写核心原理与四大类型避坑指南

简介:本资源是一份面向股票量化分析初学者与通达信用户的技术指标开发入门教程,系统讲解如何在通达信平台编写四类核心公式:技术指标(如MA、KDJ)、条件选股(如“股价低于每股净资产”)、交易系统…

2026/10/10 14:06:48 阅读更多 →
pywebview 开发者指南:环境搭建、协作工作流、测试体系与 Ruff/pre-commit 代码规范

pywebview 开发者指南:环境搭建、协作工作流、测试体系与 Ruff/pre-commit 代码规范

桌面应用前端 【免费下载链接】pywebview Build GUI for your Python program with JavaScript, HTML, and CSS 项目地址: https://gitcode.com/gh_mirrors/py/pywebview 点击查看 免费下载 本文是一份面向 pywebview 贡献者的开发指南,围绕 docs/contr…

2026/10/10 14:05:48 阅读更多 →

日新闻

卫星轨道分类全解析:从LEO到GEO的选型逻辑与工程实践

卫星轨道分类全解析:从LEO到GEO的选型逻辑与工程实践

1. 从“卫星轨道分类”这个标题说起:为什么值得花时间搞懂第一次接触“卫星轨道分类”这个概念,很多人会觉得它离自己很远——不就是天上的星星怎么转吗?但如果你正在做航天任务规划、遥感数据接收、星座设计,甚至只是准备一场航天…

2026/10/10 0:00:39 阅读更多 →
Spring AOP 核心原理与实战:从概念到日志切面落地

Spring AOP 核心原理与实战:从概念到日志切面落地

1. 从一个真实痛点说起:为什么你的代码里到处都是重复逻辑刚入行那会儿,我写过一个用户管理模块,注册、登录、改密码、注销四个接口。每个接口里都塞了几乎一样的日志打印、参数校验、事务开启和提交。当时觉得没什么,能跑就行。直…

2026/10/10 0:00:40 阅读更多 →
Python招聘数据采集与分析可视化:从采集清洗到薪资技能城市可视化全链路

Python招聘数据采集与分析可视化:从采集清洗到薪资技能城市可视化全链路

简介:这是一套面向计算机相关专业学生与项目实战学习者的Python数据采集与分析可视化完整项目,以Boss直聘岗位数据为对象,适合用作毕业设计、课程设计或期末大作业。资源包共38个文件,约246KB,以13个py源码文件为核心&…

2026/10/10 0:00:40 阅读更多 →

周新闻

KT148A语音芯片外挂8002D功放的工程实践指南

KT148A语音芯片外挂8002D功放的工程实践指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 11:14:25 阅读更多 →
LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 1:36:08 阅读更多 →
ARM架构深度解析:从RISC设计理念到交叉编译实战

ARM架构深度解析:从RISC设计理念到交叉编译实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 11:14:58 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 5:23:50 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 21:32:20 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 10:38:42 阅读更多 →