知识抽取实战:从NER、RE到LLM应用与工业级系统构建
1. 项目概述从数据到知识的“炼金术”知识抽取听起来像是一个充满学术气息的术语但如果你把它想象成一位经验丰富的淘金者在信息的河流中筛选出真正的“金块”或许就直观多了。在信息爆炸的今天我们被海量的文本、报告、对话所包围但这些数据本身是“沉默”的。知识抽取的核心任务就是让机器理解这些非结构化的文本从中自动识别、提取出结构化的、可被计算机直接处理和推理的“知识”。这些知识通常以“实体-关系-实体”的三元组形式存在比如从“苹果公司由史蒂夫·乔布斯创立”这句话中抽取出实体“苹果公司”和“史蒂夫·乔布斯”以及它们之间的关系“创立”。这个过程就是为后续的知识图谱构建、智能问答、决策支持等高级应用打下坚实的地基。我接触这个领域有年头了从最早的基于规则和词典的“笨办法”到后来统计机器学习带来的曙光再到如今大模型掀起的革命每一步都踩过不少坑。很多人觉得有了大模型知识抽取就变成了“一句话的事”但实际落地远非如此。模型可能会把“苹果”理解为水果而不是公司也可能在复杂的嵌套关系中迷失方向。因此一个健壮的知识抽取系统远不止是调用一个API那么简单它涉及对文本的深度理解、对业务场景的精准适配以及对抽取结果的置信度评估。无论你是想从海量专利文献中梳理技术脉络还是从客服对话中挖掘用户痛点亦或是构建垂直领域的知识库知识抽取都是你必须掌握的核心技能。接下来我将结合最新的技术动态比如备受关注的OneKE框架为你拆解这套“炼金术”背后的完整逻辑、实操要点以及那些只有真正做过项目才会懂的“坑”。2. 知识抽取的核心架构与范式演进知识抽取并非一个单一的技术而是一个包含多个子任务的系统工程。理解其核心架构是设计有效方案的前提。2.1 核心任务拆解实体、关系与事件一个完整的知识抽取流程通常可以分解为三个核心子任务它们像流水线一样有时串联有时联合进行。命名实体识别这是第一步也是基础。目标是从文本中找出并分类特定的实体项。传统的实体类型如人名、地名、组织机构名、时间、日期等。在垂直领域则可能扩展为产品型号、疾病名称、化学成分、法律条款等。例如在医疗文本“患者服用阿司匹林后出现胃部不适”中NER需要识别出“阿司匹林”药物实体和“胃部不适”症状实体。早期的NER严重依赖词典和规则后来基于条件随机场CRF、BiLSTM-CRF的序列标注模型成为主流它们能有效利用上下文信息。而如今基于预训练语言模型如BERT的微调方法凭借其强大的语义表征能力几乎成为了该任务的标配方案准确率有了质的飞跃。关系抽取在识别出实体的基础上RE的任务是判断两个实体之间是否存在某种预定义的关系。例如判断“苹果公司”和“史蒂夫·乔布斯”之间存在“创始人”关系。这是一个典型的分类问题。传统方法有基于模式匹配、基于特征工程结合分类器如SVM等。深度学习时代研究者设计了多种模型架构如基于注意力机制的模型、图神经网络等来更好地捕捉实体间的语义关联。一个常见的挑战是处理复杂句式和长距离依赖比如“那个由乔布斯在车库创立后来成为科技巨头的苹果公司”这里“苹果公司”和“乔布斯”的关系跨越了很长的修饰成分。事件抽取这是更复杂的任务旨在从文本中检测事件触发词通常为动词或名词并识别事件的参与角色论元。例如从“公司昨日宣布收购竞争对手”中抽取出事件类型为“企业收购”触发词为“收购”论元包括“收购方公司”、“被收购方竞争对手”、“时间昨日”。EE通常被建模为一个联合学习问题需要同时识别触发词和论元及其角色。它对模型的语义理解和结构化预测能力提出了更高要求。2.2 技术范式演进从Pipeline到Joint Model再到LLM时代知识抽取的方法论经历了清晰的演进路径理解这些范式有助于我们选择合适的技术方案。流水线范式这是最直观的方法将NER、RE、EE等任务串联起来先做实体识别再对识别出的实体对进行关系分类。它的优点是模块清晰易于开发和调试每个模块可以独立优化。但缺点也显而易见错误传播。如果NER模块将“苹果”错误识别为水果那么后续的关系抽取无论如何也不可能得到正确结果。此外实体识别和关系判断本应是相互促进的知道“乔布斯”和“苹果”可能存在“创立”关系有助于更准确地识别这两个实体而流水线模式割裂了这种联系。联合抽取范式为了克服流水线模式的缺陷联合模型应运而生。这类模型通过共享底层编码、设计统一的标注框架如序列标注、片段排列、填表等在一个模型内同时完成实体和关系的抽取。例如通过设计特殊的标签体系将“主实体-关系-客实体”的信息编码到一个序列标注任务中。联合模型能有效利用任务间的关联信息减少错误传播在多项公开数据集上取得了显著优于流水线方法的效果。然而其模型结构通常更复杂训练和调参难度也更大。大语言模型范式以GPT、ChatGPT为代表的大语言模型的出现为知识抽取带来了范式革命。其核心思想是将抽取任务转化为文本生成任务。我们可以设计精妙的提示词例如“请从以下句子中抽取所有实体及关系并以JSON格式输出{句子}。实体类型包括人物、组织、地点...关系类型包括创立于、就职于...”。LLM凭借其强大的指令遵循和上下文理解能力能够直接输出结构化的结果。这种方法的最大优势是零样本/少样本能力和极强的泛化性无需针对特定领域进行大量标注数据训练。OneKE等框架正是基于此理念致力于构建统一、易用的大模型知识抽取工具。但它的挑战在于输出格式不稳定、可能产生幻觉生成不存在的内容、对长文本处理效率低、以及API调用成本问题。实操心得在实际项目中没有“银弹”。对于标注数据丰富、对精度和稳定性要求极高的场景如金融风控联合抽取模型仍是首选。对于标注数据稀缺、需求变化快的探索性场景如新兴领域的舆情分析大模型范式具有无可比拟的优势。一个成熟的策略往往是“混合模式”用大模型快速生成伪标注数据再用其训练一个轻量级的专用抽取模型兼顾效果与成本。3. 基于深度学习的联合抽取实战解析尽管大模型风头正劲但基于深度学习的专用抽取模型在可控性、成本和稳定性上仍有不可替代的价值。这里我们以目前学术界和工业界广泛采用的“基于片段排列的联合抽取模型”为例深入其实现细节。3.1 模型选型与架构设计我们选择PaddleNLP或Hugging Face Transformers库中常见的联合抽取模型架构作为基础。其核心思想是不进行传统的序列标注而是枚举所有可能的文本片段作为候选实体然后同时判断每个片段的实体类型以及任意两个片段之间的关系。编码层采用预训练语言模型如BERT、RoBERTa、ERNIE作为编码器将输入文本转换为富含上下文信息的词向量序列。这是模型效果的基石。选择领域相关的预训练模型能极大提升效果例如在生物医学领域使用BioBERT在金融领域使用FinBERT。实体解码层这一层负责识别实体。具体来说模型会枚举所有可能的文本片段通常限制最大长度。对于每一个片段模型计算两个概率1) 该片段是一个实体的概率2) 该实体属于某个特定类型的概率。这通常通过一个全连接层加softmax来实现。为了避免组合爆炸通常会限制实体的最大长度如10个词。关系解码层这是联合抽取的关键。对于每一对被识别出的候选实体Subject, Object模型不是简单地分类而是进行一个“头尾匹配”。具体操作是将Subject和Object的向量表示、以及它们之间上下文区域的向量进行融合例如通过拼接、相加或注意力机制然后送入一个关系分类器判断是否存在关系及关系类型。同时模型还会预测一个关系矩阵其中每个单元格对应一对实体单元格的值表示关系类型。损失函数模型的损失由两部分组成实体识别损失通常是交叉熵损失和关系分类损失。两部分损失加权求和共同指导模型训练。权重的设置需要根据任务中实体和关系的相对重要性进行调整。3.2 数据准备与标注体系模型再好没有高质量的数据也是徒劳。知识抽取的数据标注是一项精细且昂贵的工作。标注规范制定这是第一步也是最容易产生后续分歧的一步。必须明确定义实体类型清单每个类型的定义、示例和边界案例例如“北京大学医院”是整体作为一个组织机构实体还是“北京大学”和“医院”分开。关系类型清单每个关系的定义、主体实体类型和客体实体类型的约束例如“创立”关系的主体必须是“人物”或“组织”客体必须是“组织”。标注指南详细说明如何标注嵌套实体、不连续实体、关系重叠等复杂情况。标注工具选择推荐使用专业标注工具如Brat、doccano、Label Studio。它们支持实体和关系的可视化标注并能导出标准格式如JSON、BIO格式。对于大规模标注需要建立质检流程例如抽样检查、双人标注计算一致性等。数据格式转换将标注工具导出的数据转换为模型训练所需的格式。通常需要生成三个文件train.json: 每条数据包含文本、实体列表每个实体有起始位置、结束位置、类型、关系列表每个关系有主体实体ID、客体实体ID、关系类型。dev.json: 验证集用于训练过程中评估模型性能防止过拟合。test.json: 测试集用于最终评估模型效果。注意事项标注数据中的类别不平衡问题非常普遍例如“位于”关系可能远多于“并购”关系。需要在损失函数中考虑类别权重如Focal Loss或在数据层进行过采样/欠采样否则模型会严重偏向多数类。3.3 模型训练、评估与优化准备好数据和代码后就可以开始模型训练了。训练参数调优学习率这是最重要的参数之一。对于微调预训练模型通常使用较小的学习率如2e-5到5e-5。可以使用学习率预热Warmup策略避免初期震荡。批次大小在GPU内存允许的情况下尽可能使用较大的批次大小有助于训练稳定。如果内存不足可以累积梯度模拟大批次训练。训练轮数需要监控验证集上的性能如F1值当性能连续多个轮次不再提升时应提前停止训练避免过拟合。评估指标知识抽取的评估比简单分类复杂。实体评估采用精确率、召回率、F1值。评估时要求实体边界和类型都正确才算正确。关系评估通常采用严格匹配和宽松匹配。严格匹配要求关系三元组主体实体、关系、客体实体的边界和类型完全正确宽松匹配可能只要求关系类型正确或允许实体边界有轻微误差。在学术论文中常见的是严格匹配的F1值。端到端评估从原始文本输入到最终的三元组输出计算整体的F1值这是最贴近实际应用的评估方式。效果优化技巧对抗训练在训练过程中对词向量添加小的扰动可以提高模型的鲁棒性和泛化能力。外部知识注入如果领域内有实体词典或知识库可以将其作为特征融入模型。例如在输入层除了词向量还可以拼接一个“是否在词典中”的特征向量。模型集成训练多个不同初始种子或不同模型架构的模型对它们的预测结果进行投票或平均通常能稳定提升1-2个百分点的性能。后处理规则针对模型常见的系统性错误可以制定简单的后处理规则进行修正。例如如果模型总是把“XX有限公司”的后两个字单独抽成实体可以添加规则进行合并。4. 大模型知识抽取框架OneKE深度应用指南当标注数据有限或需要快速原型验证时大模型方案的优势就凸显出来。OneKEOne Knowledge Extraction作为一个代表性的大模型知识抽取框架其设计理念和用法值得深入研究。4.1 OneKE的核心思想与工作流程OneKE的核心是提示工程和结构化输出控制。它并不训练一个新模型而是通过精心设计提示词引导现有的大语言模型如GPT-4、ChatGLM、文心一言等完成抽取任务。其典型工作流程如下任务定义用户定义需要抽取的实体类型和关系类型并提供少量示例少样本学习。提示构建框架根据任务定义自动构建一个结构化的提示模板。这个模板通常包括任务描述、格式说明、实体和关系定义、少量示例In-Context Learning、以及待处理的文本。调用LLM将构建好的提示发送给大模型API。结果解析与后处理接收大模型返回的自然语言或伪结构化文本通过解析器如正则表达式、JSON解析将其转换为标准的三元组格式。框架会处理模型输出可能存在的格式不一致、冗余或缺失问题。4.2 提示词设计的关键策略提示词的质量直接决定了大模型抽取的效果。以下是一些经过验证的有效策略角色扮演与指令明确化给模型赋予一个明确的角色并给出清晰的指令。较差示例“从这段话里找出实体和关系。”推荐示例“你是一个专业的知识图谱构建专家。你的任务是从给定的文本中精确抽取出所有实体和关系。请严格按照以下要求操作...”结构化输出格式限定明确要求模型以特定格式如JSON、XML、Markdown表格输出这极大方便了后续的自动解析。请以如下JSON格式输出结果 { entities: [ {text: 实体文本, type: 实体类型, start_idx: 起始位置, end_idx: 结束位置} ], relations: [ {subject: 主体实体文本, predicate: 关系类型, object: 客体实体文本} ] }提供高质量示例在提示词中提供2-3个清晰、典型的示例少样本学习能显著提升模型在未知文本上的表现。示例应覆盖不同的句式和不常见的案例。分步思维链对于复杂文本可以要求模型分步推理。例如“第一步先找出文本中所有可能的命名实体。第二步针对每一对实体判断它们之间是否存在预定义的关系。” 这种方法Chain-of-Thought能提高复杂逻辑处理的准确性。处理歧义与负样本在提示中明确告知模型如何处理歧义和不存在的情况。如果某个实体类型无法确定请将其类型标记为“UNK”。 如果两个实体之间不存在任何预定义的关系请不要生成它们之间的关系。4.3 OneKE实战配置与调优假设我们使用一个开源的OneKE框架或类似工具其配置通常围绕提示模板和模型参数展开。基础配置示例YAML格式extraction_task: name: company_investment entity_types: [Company, Person, Location, Money] relation_types: [invest_in, found, located_in] llm_backend: provider: openai # 或 azure, anthropic, local如ChatGLM model_name: gpt-3.5-turbo api_key: ${OPENAI_API_KEY} temperature: 0.1 # 低温度使输出更确定减少随机性 max_tokens: 2000 prompt_template: system_role: 你是一个金融信息抽取专家。 instruction: | 请从以下文本中抽取出所有实体和关系。 实体类型{{entity_types}}。 关系类型{{relation_types}}。 请严格按照下面的JSON格式输出不要输出任何其他解释性文字。 examples: - text: 特斯拉CEO埃隆·马斯克宣布在上海投资建厂。 output: {entities:[{text:特斯拉,type:Company,start_idx:0,end_idx:3}, {text:埃隆·马斯克,type:Person,start_idx:7,end_idx:13}, {text:上海,type:Location,start_idx:17,end_idx:19}], relations:[{subject:埃隆·马斯克,predicate:found,object:特斯拉}, {subject:特斯拉,predicate:invest_in,object:上海}]}高级调优策略动态少量示例选择不是固定提供示例而是从示例库中动态选择与当前待处理文本最相似的几个示例作为提示的一部分这被称为“示例检索”。这能进一步提升少样本学习的效果。自我一致性对于同一段文本让大模型在较高温度下生成多次输出如3-5次然后对所有输出结果进行投票选择出现频率最高的三元组作为最终结果。这能有效减少模型的随机错误。迭代式抽取与验证对于非常长的文档可以先让模型抽取高层次的核心实体和关系再针对每个核心实体所在的段落进行细粒度抽取。或者让模型先抽取再让其自己对抽取结果进行可信度评估和修正。成本与延迟优化对于大批量处理可以考虑使用更便宜的模型如GPT-3.5-Turbo进行初筛再对低置信度的结果用更强大的模型如GPT-4进行复核。同时合理设置max_tokens以避免生成过长无用内容。踩坑实录大模型抽取最大的坑在于“幻觉”和“格式漂移”。我曾遇到模型自己编造了一个文中没有的公司并为之创建了关系。解决方法除了降低temperature就是在后处理中增加严格的验证检查抽取出的实体原文是否真的存在其边界是否合理。对于格式问题必须编写健壮的解析器能处理JSON中多余的逗号、缺失的引号等常见错误并准备好降级方案如正则表达式回退提取。5. 工业级系统构建从原型到生产将一个知识抽取模型或框架投入实际生产环境会面临一系列在实验室中遇不到的挑战。构建一个健壮的工业级系统需要从架构上考虑周全。5.1 系统架构设计一个典型的生产级知识抽取系统通常采用微服务架构包含以下核心组件文本预处理服务负责接收原始文本可能是HTML、PDF、Word等进行清洗、去噪、分句、编码转换。对于长文档需要设计合理的切分策略如按段落、按章节确保切分后的片段在语义上相对完整且不超过模型的最大输入长度限制。抽取引擎这是核心服务。它可能封装了多个抽取模型专用深度学习模型用于处理高精度、高并发的核心业务。大模型代理服务用于处理零样本、低频率或高难度的长尾需求。规则引擎对于一些固定模式、高确定性的抽取需求如抽取电话号码、邮箱规则引擎速度快、准确率100%仍是不可或缺的补充。 引擎需要实现模型的热加载、版本管理、AB测试分流等功能。后处理与融合模块负责对多个引擎或多次抽取的结果进行融合、去重、冲突消解和置信度校准。例如当深度学习模型和大模型结果不一致时如何裁决可以基于历史准确率设置权重进行投票或引入人工审核队列。知识存储与服务层将最终的结构化三元组存储到图数据库如Neo4j、Nebula Graph或关系型数据库中并提供查询API供上游的搜索、推荐、问答等应用调用。监控与反馈闭环系统需要实时监控抽取的吞吐量、延迟、成功率。更重要的是要建立反馈机制将线上识别出的错误案例通过人工抽检或用户反馈自动收集加入到标注池中用于后续的模型迭代训练形成持续优化的闭环。5.2 性能、成本与效果权衡在生产环境中纯粹的学术指标如F1值不是唯一的考量必须在性能、成本和效果之间找到平衡点。性能优化模型蒸馏将大型、复杂的教师模型如BERT-large的知识“蒸馏”到小型、高效的学生模型如TinyBERT中在几乎不损失精度的情况下大幅提升推理速度。量化与剪枝对模型参数进行量化如从FP32到INT8和剪枝移除不重要的神经元连接减少模型体积和计算量便于在CPU或边缘设备上部署。服务化优化使用高性能推理框架如TensorRT、ONNX Runtime、Triton Inference Server实现批量预测、异步处理充分利用硬件资源。成本控制混合调度策略设计智能的路由策略。对于简单、高频的查询走轻量级规则或小模型对于复杂、低频的查询走大模型通道。这需要对查询文本进行难度预分类。缓存机制对于相同的或高度相似的文本输入其抽取结果可以缓存一段时间避免重复计算尤其适用于新闻热点、重复咨询等场景。异步处理与队列对于非实时性要求高的任务可以采用消息队列进行异步处理平滑请求高峰节省即时计算资源。效果保障置信度评分模型在输出三元组的同时应输出一个置信度分数。低置信度的结果可以进入人工审核流程避免错误知识污染下游系统。一致性校验利用知识本身的逻辑进行校验。例如抽取出“A是B的子公司”和“B是A的子公司”这两个矛盾的关系系统应能识别并标记为冲突等待人工处理。领域自适应通用模型在垂直领域效果会下降。必须建立领域语料库持续进行领域自适应预训练或微调。5.3 常见生产问题与排查手册即使经过充分测试系统上线后仍会遇到各种问题。以下是一个快速排查手册问题现象可能原因排查步骤与解决方案抽取结果大量缺失低召回率1. 文本编码/清洗问题导致乱码。2. 文本切分不合理割裂了实体或关系。3. 模型或提示词未覆盖该领域实体/关系类型。1. 检查预处理后的文本内容是否正常。2. 检查切分边界附近的实体是否完整调整切分策略如重叠切分。3. 分析未抽取出的案例补充领域词典或调整模型/提示词。抽取结果错误百出低准确率1. 模型过拟合或欠拟合。2. 训练数据与线上数据分布差异大领域漂移。3. 大模型提示词歧义或示例不当。4. 实体链接错误同一实体多个指称。1. 检查验证集效果重新调整模型超参或增加数据。2. 收集线上数据进行领域自适应训练。3. 优化提示词增加约束和清晰示例。4. 引入实体链接或消歧模块将“苹果”、“Apple Inc.”链接到同一实体。系统响应缓慢1. 单次处理文本过长。2. 模型推理未优化资源占用高。3. 服务并发数设置不合理资源竞争。1. 优化文本切分限制单次输入长度。2. 对模型进行蒸馏、量化、使用更高效推理引擎。3. 监控服务资源CPU/内存/GPU调整服务实例数和线程池配置。大模型API调用频繁失败或超时1. 网络波动或API服务不稳定。2. 请求频率超限Rate Limit。3. 提示词过长导致Token超限。1. 实现重试机制如指数退避。2. 在客户端实现请求队列和限流。3. 精简提示词压缩示例或采用分步查询策略。存储的知识出现矛盾1. 不同来源或不同批次抽取的结果冲突。2. 知识本身随时间演变如公司并购。1. 建立冲突检测与消解规则如基于时间戳、数据源可信度进行裁决。2. 为知识引入“有效期”或“版本”概念支持知识的新增、废弃与更新。构建一个稳定可靠的知识抽取系统是一个持续迭代和优化的过程。它不仅仅是算法问题更是工程问题、数据问题和业务问题的综合。从选择一个合适的范式开始精心准备数据耐心调优模型设计稳健的架构到最后建立监控与反馈的闭环每一步都需要对细节的深入理解和丰富的实战经验。知识抽取作为连接非结构化文本与结构化知识的桥梁其价值会在智能搜索、深度分析、辅助决策等无数下游应用中不断放大。

相关新闻

大厂面试中的技术深度与工程思维考察

大厂面试中的技术深度与工程思维考察

1. 面试奇遇记背后的行业现象 最近技术圈流传着一份西安电子科技大学cjc同学的大厂面试实录,这场持续近两小时的"攻防战"意外成为了程序员群体热议的典型案例。作为经历过上百场技术面试的面试官,我发现这个案例恰好折射出当前校园招聘中普遍存…

2026/8/26 10:51:58 阅读更多 →
Jupyter Notebook 完全指南:从原理到实战的必读教程

Jupyter Notebook 完全指南:从原理到实战的必读教程

如果一个课程在 Day 4 就专门留出一整节来讲 Jupyter Notebooks,那说明它不仅是"顺手用一下的工具",而是整套课程内容的承载方式。NTMSS2023 这类密集型训练营(包括很多机器学习、神经科学、数据科学方向的暑期课程)之所…

2026/8/26 10:51:58 阅读更多 →
AI时代数据保护新挑战:从传统备份到数据韧性平台的演进与实践

AI时代数据保护新挑战:从传统备份到数据韧性平台的演进与实践

1. 当AI成为数据洪流的“新引擎”,我们如何守住最后一道防线?最近和几个做数据运维和开发的朋友聊天,话题总绕不开AI。大家一边兴奋地讨论着用大模型重构业务流程、用Agent自动化处理任务,一边又隐隐有些焦虑。这种焦虑不是来自技…

2026/8/26 10:50:57 阅读更多 →

最新新闻

基于PCA-PLS的近红外光谱分析预测菠萝含水率:Matlab实战指南

基于PCA-PLS的近红外光谱分析预测菠萝含水率:Matlab实战指南

1. 项目概述:当近红外光谱遇上菠萝含水率在农产品品质检测领域,快速、无损地测定内部成分一直是追求的目标。近红外光谱技术因其快速、无损、环保的特点,成为了水果内部品质检测的利器。然而,光谱数据维度高、信息冗余、噪声干扰等…

2026/8/26 11:32:13 阅读更多 →
Trae AI IDE实战:从代码补全到自动执行,重定义AI编程工作流

Trae AI IDE实战:从代码补全到自动执行,重定义AI编程工作流

这个软件我愿称之为本年度最伟大发现!!!—— Trae AI IDE 上手体验与工程实践如果这一年你也在关注AI编程工具,一定有类似的感受:GitHub Copilot能补全代码,Cursor能在对话框里聊天,但真正让你把…

2026/8/26 11:32:13 阅读更多 →
C++工程实战:构建-调试-测试闭环开发指南

C++工程实战:构建-调试-测试闭环开发指南

1. 这不是“又一套C教程”,而是一份能让你真正写出可运行、可调试、可交付代码的实战路线图 你搜过“C全套教程(高清版)”——页面上堆满几十小时的录屏、密密麻麻的目录树、从“Hello World”讲到“模板元编程”的庞然大物。但真正坐下来敲代…

2026/8/26 11:32:13 阅读更多 →
从零手搓MCP Server:深入理解AI工具扩展协议与Python实战

从零手搓MCP Server:深入理解AI工具扩展协议与Python实战

1. 从“调API”到“造轮子”:为什么我们需要亲手实现一个MCP Server? 如果你最近在AI应用开发领域,尤其是围绕Claude、Cursor这类智能编码工具,那么“MCP”这个词一定高频地出现在你的视野里。Model Context Protocol,…

2026/8/26 11:32:13 阅读更多 →
软件测试入门:从核心概念到实战流程的完整指南

软件测试入门:从核心概念到实战流程的完整指南

1. 项目概述:为什么软件测试是技术人的必修课刚入行那会儿,我总觉得写代码才是硬核技术,测试嘛,点点鼠标、看看界面,能有多难?直到我负责的第一个项目上线后,因为一个边界值没测到,半…

2026/8/26 11:32:13 阅读更多 →
深度学习矿物识别项目实战:从图像分类到zip交付的完整链路

深度学习矿物识别项目实战:从图像分类到zip交付的完整链路

简介:深度学习在图像分类领域的应用已从通用物体识别延伸到专业场景,矿物识别便是典型方向之一。卷积神经网络通过卷积与池化操作提取颜色、纹理、晶形等视觉特征,配合迁移学习、数据增强等技巧,能够在有限样本下实现高精度分类。…

2026/8/26 11:31:11 阅读更多 →

日新闻

Python random 模块常用函数详解:从入门到实战

Python random 模块常用函数详解:从入门到实战

目录 1. 引言2. 准备工作3. 基础随机函数4. 序列相关函数5. 随机种子与复现6. 实战案例7. 注意事项8. 常见问题与排查9. 总结 1. 引言 摘要: 本文系统介绍 Python 标准库 random 模块中最常用的随机数生成函数。内容涵盖基础随机函数(random()、unifor…

2026/8/26 0:00:40 阅读更多 →
《Microsoft Sql server 2008 Internals》读书笔记--第三章Databases and Database Files(2)

《Microsoft Sql server 2008 Internals》读书笔记--第三章Databases and Database Files(2)

《Microsoft Sql server 2008 Internals》索引目录: 《Microsoft Sql server 2008 Internals》读书笔记--目录索引 在上篇文章中,主要介绍了创建数据库的基本语法和FileGroup的初步知识。需要注意的是: 关于FileGroup 如果你的系统是用Raid设备直接存…

2026/8/26 1:18:18 阅读更多 →
政务AI智能体怎么建?三种模式、三步路径与四个误区

政务AI智能体怎么建?三种模式、三步路径与四个误区

政务AI智能体已经从概念试点阶段,转入了政务服务的常态化落地应用;在实际使用过程中,它能自主理解办事需求、辅助完成填报申报、开展材料预审,并联动多个系统协同作业,真正嵌入到政务办理的全流程当中。但在落地推进过…

2026/8/26 1:18:18 阅读更多 →

周新闻

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/25 3:38:12 阅读更多 →
SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/25 3:38:18 阅读更多 →
Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/25 3:38:23 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/26 3:50:20 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/25 10:31:12 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/26 1:24:05 阅读更多 →