SeLATM面向数据探索与资源效率的片段级智能体主题建模arXiv编号arXiv:2609.31460v1摘要主题建模是挖掘文档集合隐藏主题的有效技术广泛应用于多行业文本挖掘与数据分析。近期出现基于大语言模型LLM的主题建模方法通过提示大模型生成主题再将主题分配给文档输出的主题可读性显著优于LDA等传统算法。但该类方案存在明显缺陷无法输出单篇文档上的多主题分布主题粒度容易过宽或过窄计算资源开销随文档数量、文档长度急剧增长对工业级大数据场景非常不友好。本文提出**SeLATMSegment‑Level Agentic Topic Modeling片段级智能体主题建模**框架解决上述痛点。采用片段级主题生成搭配智能体反馈迭代精炼回路。多组数据集实验表明SeLATM相比传统LLM主题建模方法大幅降低LLM调用资源消耗同时取得更优建模质量。关键词主题建模片段级聚类智能体反馈回路大语言模型文本挖掘工业数据分析目录引言SeLATM框架2.1 片段级主题建模2.2 智能体主题精炼反馈回路2.3 多视图父级主题构建实验设计3.1 数据集3.2 评测指标3.3 基线方法3.4 模型与超参数实验结果4.1 公开数据集实验结果4.2 业务数据集实验结果4.3 LLM Token消耗对比4.4 父级主题建模效果相关工作结论参考文献附录A 评测指标、基线实现、消融实验附录B 全套提示词附录C 输出样例1 引言主题建模用于从语料库挖掘有意义主题在科研、工业数据探索场景大量使用。传统方法如LDA把主题表示为词分布。而LLM驱动方案直接提示模型生成人类可读的自由文本主题并将主题分配给文档。现有LLM主题建模存在三大核心痛点无法输出文档‑多主题分布现实中文档通常覆盖多个主题不同主题占比各不相同现有LLM方案大多给文档分配单一主题即便支持多主题也不能量化每个主题对文档的贡献占比可解释性不足。资源开销巨大需要对每篇文档做主题分配LLM调用复杂度O ( N × L ) O(N\times L)O(N×L)N NN文档数L LL文档长度长文档金融、法律业务场景开销爆炸。主题精炼能力不足多数方案完全忽略精炼步骤或者只做主题合并仅做合并会产生过于宽泛、内部不一致的大主题缺少主题拆分能力。本文核心思想不在完整文档粒度做主题分配将文档切分为句子/段落片段对片段聚类簇生成主题从片段粒度向上聚合得到文档的多主题贡献分布再引入多智能体协作的反馈回路同时支持主题拆分、主题合并双向精炼。本文主要贡献提出SeLATM片段级主题建模文档切分为文本片段对片段聚类簇生成主题省去逐文档主题分配步骤可以输出每篇文档的多主题贡献占比显著降低LLM资源开销。设计智能体迭代精炼反馈回路包含一致性评估智能体、多样性评估智能体、拆分智能体、合并智能体、规划智能体同时支持主题拆分、合并双向操作修正过宽/过窄主题。实现多视图聚类构建父级高层主题得到层级主题结构。在公开数据集与3套无真值工业金融业务数据集开展实验SeLATM在多数指标优于基线token开销显著低于同类LLM主题建模方案。2 SeLATM框架2.1 片段级主题建模写作基本原理句子、段落片段通常聚焦单一核心主题语义相近片段组成的聚类簇天然对应一个公共主题。完整步骤文本切分将文档D i D_iDi切分为文本片段D i { s i 1 , s i 2 , … , s i M } D_i\{s_{i1},s_{i2},…,s_{iM}\}Di{si1,si2,…,siM}使用句法规则切分句子/段落不依赖LLM做切分避免引入额外开销。片段向量化与聚类e i j E m b ( s i j ) e_{ij}Emb(s_{ij})eijEmb(sij)使用凝聚层次聚类Agglomerative Clustering相比K‑means稳定性更强输出片段簇集合C { C 1 , C 2 , … , C K } \mathcal C\{C_1,C_2,…,C_K\}C{C1,C2,…,CK}。K KK为用户设定超参数代表主题粒度不是严格真值数量下游精炼回路会修正粒度。MMR采样大簇使用最大边际相关性MMR采样选出代表性片段减少送入LLM的输入长度。C ~ k { C k if ∣ C k ∣ ≤ n S S a m p l e M M R ( C k , n S ) otherwise \tilde{C}_{k} \begin{cases} C_{k} \text{if } |C_{k}| \leq n_S \\ Sample_{MMR}(C_{k}, n_S) \text{otherwise} \end{cases}C~k{CkSampleMMR(Ck,nS)if∣Ck∣≤nSotherwisen S n_SnS每一个簇采样片段数量超参数。主题生成智能体A T G A_{TG}ATG输入簇采样片段输出主题名称主题描述( t k , d k ) A T G ( C ~ k ) (t_k,d_k) \mathcal{A}_{TG}(\tilde{C}_k)(tk,dk)ATG(C~k)文档‑主题分布计算基于文档内部各个片段所属簇统计得到文档D i D_iDi的主题分布p i k p_{ik}pik代表主题t k t_ktk对该文档的贡献占比p i k 1 ∣ D i ∣ ∑ j 1 M 1 ( f c ( s i j ) C k ) p_{ik} \frac{1}{|D_i|}\sum_{j1}^{M} \mathbb 1\left(f_c(s_{ij})C_k\right)pik∣Di∣1j1∑M1(fc(sij)Ck)计算复杂度收益LLM调用复杂度由原来O ( N × L ) O(N\times L)O(N×L)降低为O ( K × n S × l ) O(K\times n_S \times l)O(K×nS×l)K KK主题数n S n_SnS采样数l ll片段平均长度三者远小于原始N NN、L LL。2.2 智能体主题精炼反馈回路算法伪代码Algorithm 1defagentic_refinement_loop(Tg,C,C_tilde,e_max,T_tol): Tg: {(t1,d1)...(tK,dK)} 主题与描述 C: 完整片段簇集合 C_tilde: MMR采样后簇 e_max: 最大迭代轮次 T_tol: 容忍上限连续无改善则提前终止 tolerance0foriinrange(e_max):iftoleranceT_tol:break# 拷贝当前状态Ci,Ctil_i,Tgicopy(C),copy(C_tilde),copy(Tg)# 1.一致性评估输出拆分反馈coh_fbEcoh(Ctil_i,Tgi)Ci,TgiAsplit(coh_fb,Ci,Tgi)Ctil_iupdate_sample_clusters(Ci)# 2.多样性评估输出合并反馈div_fbEdiv(Tgi)Ctil_i,TgiAmerge(div_fb,Ctil_i,Tgi)Ciupdate_full_clusters(Ctil_i)# 3.重评估coh_r_fbEcoh(Ctil_i,Tgi)div_r_fbEdiv(Tgi)# 规划智能体判断迭代是否带来改进outAplan(coh_fb,coh_r_fb,div_fb,div_r_fb)ifout.is_improved:C,C_tilde,TgCi,Ctil_i,Tgi tolerance0else:tolerance1returnC,C_tilde,Tg各智能体分工一致性评估智能体E c o h E_{coh}Ecoh评估主题名称、描述与簇内片段匹配一致性一致性差标记该主题需要拆分并给出改进反馈。拆分操作智能体A s p l i t A_{split}Asplit对需要拆分的簇重新聚类为2个子簇如果拆分后其中一个子簇占比80%跳过拆分否则使用E c o h E_{coh}Ecoh反馈提示A T G A_{TG}ATG为新子簇生成主题名称描述更新簇集合。多样性评估智能体E d i v E_{div}Ediv全局评估全部主题之间区分度识别应当合并的主题分组输出合并改进反馈。合并操作智能体A m e r g e A_{merge}Amerge合并指定簇采样片段结合反馈调用A T G A_{TG}ATG生成合并后主题。规划智能体A p l a n A_{plan}Aplan对比迭代前后主题质量报告判断本轮迭代是否产生有效改进连续多轮无改善达到容忍阈值提前终止循环。要点现有基线大多只有合并操作SeLATM同时具备拆分合并双向能力解决主题过度宽泛的问题。2.3 多视图父级主题构建在得到基础主题之后构建高层父主题形成层级主题体系对每个主题构建多视图嵌入拼接片段簇质心嵌入、主题名字嵌入、主题描述嵌入。在主题层面再次执行凝聚层次聚类。使用主题生成智能体A T G A_{TG}ATG为高层聚类簇生成父主题名称、描述。3 实验设计3.1 数据集公开数据集带真值标签Banking771947条金融意图分类数据集Bills1000条法案文档Wiki1100条长维基文档内部业务数据集无真值标签摩根大通金融业务CCC客户聊天机器人会话603条BCR聊天机器人用户评论1250条CI客户问题摘要3000条数据集数据规模Token平均长度标签数量Banking771 9471377Bills1 000233101Wiki1 1003 950207CCC603116‑BCR1 25015‑CI3 00017‑3.2 评测指标聚类类指标有真值数据集P1纯度调和平均ARI调整兰德指数NMI归一化互信息。SeLATM输出多主题分布评测取贡献占比最高主题作为预测标签出现占比相同视为新类别。LLM‑as‑Judge大模型裁判指标全部数据集均可使用TA主题准确率Topic AccuracyTC主题完备度Topic Completeness。使用自一致性解码生成5条推理路径打分取平均打分档位0 / 1/3 / 2/3 / 1。TA标签TC标签得分INCORRECTNOT COVERED0PARTIALLY CORRECTMINORLY COVERED1/3MOSTLY CORRECTMOSTLY COVERED2/3COMPLETELY CORRECTCOMPLETE13.3 基线方法嵌入类主题模型BERTopicC‑Top2VecLLM驱动主题生成逐文档分配TopicGPTLLooMTIDELLM辅助神经主题模型LLM‑ITL3.4 模型与超参数主题生成智能体gpt‑4o‑2024‑08‑06向量化模型text‑embedding‑3‑small‑1LLM‑as‑Judge裁判模型gpt‑4.1‑mini‑2025‑04‑14超参数K KK主题数量Banking77/Bills100Wiki250业务数据集50n S n_SnS簇采样片段数通过网格搜索确定迭代轮次0 /1 /3 /5轮精炼回路。4 实验结果4.1 公开数据集实验结果SelATM‑Iter:0代表不开启精炼回路Iter:1/3/5代表开启对应轮次智能体精炼。在不开启精炼Iter:0条件下15项评测中有10项取得最优TA主题准确率相比最优基线平均提升21%。聚类指标P1、ARI、NMI受精炼回路影响很小拆分合并只修改部分主题命名大部分片段‑簇归属保持不变。LLM裁判指标TA、TC在迭代3轮时整体达到峰值t检验p0.05对比Iter‑0具备统计显著提升迭代到5轮部分数据集性能出现回落过多迭代带来过度合并主题变得宽泛模糊。4.2 业务数据集实验结果业务数据集无真值标签只报告LLM‑as‑Judge指标TA、TC。Iter‑0版本在6项评测中5项显著优于基线开启精炼之后进一步提升BCR数据集Iter‑5取得最佳CCC数据集Iter‑3最优CI数据集迭代收益不显著迭代过多会出现主题泛化导致指标下滑。4.3 LLM Token消耗对比Iter‑0无精炼token消耗仅为TIDE的24.4%TopicGPT的8.19%Iter‑1约为TIDE的55%Iter‑3‑5token开销上升但依然低于TopicGPT。证明片段级策略可以大幅降低LLM调用成本工业大数据场景收益明显。4.4 父级主题建模效果父主题平均可以达到基础主题92%的TA/TC性能相比基线TIDEBills、Wiki数据集TA、TC分别达到2.2倍、2.6倍提升多视图聚类构建层级主题效果显著。5 相关工作传统主题建模LDA、NMF基于词袋BERTopic、C‑Top2Vec使用文档嵌入做聚类。缺点主题是词分布人类可读性差。LLM驱动主题建模TopicGPT、LLooM、TIDE直接让大模型生成可读主题但是需要逐文档做主题分配计算开销高多数方案只支持主题合并缺少拆分能力。LLM‑ITL神经主题建模为主LLM仅做主题重命名降低开销但主题命名质量有限。LLM智能体迭代自精炼Self‑Refine系列工作依靠反馈循环迭代优化输出SeLATM将该思想引入主题建模领域设计拆分/合并双向操作。6 结论针对现有LLM主题建模无法输出多主题分布、资源开销高、主题粒度难以控制的痛点本文提出SeLATM片段级智能体主题建模框架。在片段粒度完成聚类与主题生成省去逐文档主题分配可以输出文档的多主题贡献占比同时显著降低LLM token开销。引入多智能体双向精炼回路同时支持主题拆分、合并操作修正过宽、过窄主题进一步提升主题命名质量。多视图聚类生成父级高层主题得到层级主题体系。在公开数据集以及金融行业业务数据集验证SeLATM在主题准确率、完备度指标整体优于对比基线即便开启精炼迭代多数情况下token开销仍然低于现有LLM主题建模方案。局限性迭代轮次过高会发生过度合并主题泛化导致性能下降未来工作改进规划智能体的判断逻辑识别过度合并现象。7 参考文献完整参考文献查阅原始arXiv网页https://arxiv.org/html/2609.31460v1附录简要说明附录A聚类指标完整公式基线实现说明K‑means对比消融拆分操作消融n S n_SnS超参数网格搜索完整表格。附录B全套智能体提示词主题生成、一致性评估、拆分、合并、规划智能体prompt、Pydantic结构化输出schema。附录C公开数据集、业务数据集主题输出样例。