生物信息学数据库与检索:GenBank与二级数据库实战
简介这份PPT系统讲解生物信息学数据库及检索方法面向生物信息学入门者、生命科学领域研究生以及需要处理生物数据的计算机背景学习者帮助理清核苷酸数据库GenBank、EMBL、DDBJ、蛋白质数据库、Taxonomy、Pubmed等常用资源以及MySQL、AceDB等数据库工具的核心概念与应用场景并涉及投稿前序列提交规范和关键词、序列相似性等检索方式。资源为1个PPTX演示文稿压缩包约15MB共127张幻灯片内容从数据库基本定义、GenBank分区与记录标识到EST、UniGene、dbSTS等二级数据库实例层次分明适合自学或课堂、组会汇报参考。已有88人浏览学习。课件不仅说明三大核苷酸数据库的更新、来源物种和共享机制也给出具体序列条目样例与染色体定位等实际操作能帮助读者快速建立生物信息学数据库的整体框架并提升信息检索与数据利用能力适合用于课程预习、考试复习和科研入门。1. 生物信息学数据库与检索这套127页PPT把最该懂的库讲透了生物信息学数据库是收集、整理、储存、加工、发布和检索生物数据的系统论文投稿前把序列提交进库、做分析前先检索别人的数据都绕不开它。很多初学者一上来就扎进BLAST和各种组学分析反而把最基础的“数据库与检索”落下了。这套127页的PPT把核苷酸数据库、蛋白质数据库、GenBank的flatfile结构、以及dbEST/UniGene/dbSTS/dbGSS这类二级数据库串成了一条线还专门讲了纯文本、MySQL和AceDB三种数据库工具的选型。适合刚入门生物信息学、想系统补一遍数据库基础的研究生和从业者有分析经验但没系统梳理过数据库结构的熟手也能快速核对概念。计算机背景的读者想切入生物信息学这份材料同样能补齐领域侧的数据组织知识。2. 数据库工具选型纯文本数据库、MySQL与AceDB的适用边界2.1 数据库记录的两层结构原始数据加注释PPT开头给了生物数据库最核心的定义用于收集、整理、储存、加工、发布和检索数据的系统。注意这不是泛指关系型数据库里的“表”而是特指生物学科里一套完整的组织方式。每条记录通常包含两部分一是原始数据序列本身二是对数据做的生物学注释比如基因名、功能描述、来源物种、染色体定位。很多新手下载回来一条核苷酸序列只盯着序列字母看忽略了注释区这是最典型的错误——注释才是数据库检索的价值所在。一份数据库记录往往不是孤立的一个库通常会链接多个相关数据库。比如核苷酸库里的某个条目可能链向Protein、PubMed文献、Taxonomy分类信息甚至UniGene基因群。所以你在理解生物数据库时要把它当成一张网而不是一个文件夹。这个认知贯穿整套PPT的后续章节后面讲到的所有二级数据库本质上都是这张网上的节点。2.2 纯文本数据库GenBank与EMBL的组织方式生物信息学里最早大量应用的建库方式是纯文本数据库。GenBank数据库和EMBL核苷酸数据库是两大代表。它们在结构上是“纯文本”的也就是把每条序列连同注释写成一个flatfile扁平文件按固定格式组织用关键字行做标记后续章节会详细展开flatfile的内部字段。这种做法的好处是简单、可移植、任何平台都能打开程序处理也容易代价是查询效率不高主要靠文本检索工具配合数据量大了之后响应速度会明显下降。对于教学、小规模共享、以及历史数据的存档纯文本依然够用NCBI至今仍在以flatfile形式发布GenBank的完整release这也是为什么理解flatfile格式是一项基础功。提示纯文本数据库不等于“没有结构”。flatfile的每个字段位置和缩写都有明确约定解析时必须按规范逐行处理否则一个换行符的差异就可能导致整条记录读错。2.3 MySQL与SQL结构化查询把序列元数据变成可检索的表当数据量上去了纯文本就撑不住了这时就要引入真正的数据库管理系统。PPT里特别点到MySQL数据库工具强调SQL是世界上流行且标准化的数据库语言能够快速灵活地存储记录文件和图像。放在生物信息学场景里常见做法是把flatfile里的关键字段拆出来建表让所有日常检索都变成标准SQL操作-- 建一张序列信息表管理序列的注册号、物种、基因名和序列长度 CREATE TABLE sequence_record ( accession VARCHAR(32) PRIMARY KEY, -- 注册号如水稻基因OsDR8的登录号 locus_name VARCHAR(32), -- 位点名对应GenBank的LOCUS行 organism TEXT NOT NULL, -- 物种信息 gene_name VARCHAR(64), -- 基因名例如OsDR8 seq_length INT, -- 序列长度 definition TEXT, -- 注释描述 raw_sequence LONGTEXT -- 原始序列本体 ); -- 常见检索按基因名查所有水稻序列 SELECT accession, locus_name, seq_length FROM sequence_record WHERE gene_name OsDR8 AND organism LIKE %Oryza%;这段SQL说明了把flatfile导入MySQL之后的典型用法把每条GenBank记录的注册号、位点名、物种、基因名拆成字段之后所有查询都变成标准SQL语句。“增删改查”四个动作清清楚楚检索可以按基因名、物种、长度范围任意组合这是纯文本做不到的。不过要泼一盆冷水MySQL这类关系型数据库适合存元数据和注释但不适合直接存大段序列做比对分析。真实场景里序列本身往往以FASTA文件落盘数据库里只存注册号和文件路径。生物信息学专用的序列检索如BLAST有自己独立的索引机制和SQL没有直接关系很多初学者在这里混淆以为序列比对也要靠SQL完成——这个认知后面会反复踩坑。PPT里提到“下载MySQL”并给出了一个形似“: ///11”的地址占位实际课件里这页通常是视频截图或链接失效状态。遇到这种情况不用死磕MySQL官网的社区版即可满足本地测试。2.4 AceDB为基因组数据设计的灵活工具第三类工具是AceDBA C. elegans DataBase线虫数据库PPT里给出的版本号是0.84。尽管最初为线虫基因组设计它后来被广泛应用为管理和提供基因组数据的工具特点是对数据形式的兼容性好遗传图谱、物理图谱、新陈代谢途径、序列等都能组织进来。AceDB与MySQL的核心理念不同它不强制你把数据先规范化成一张张表而是用非规范化的对象模型存储属性可以灵活附加适合基因组项目里那些“还没有统一schema”的异构数据。对今天的从业者来说AceDB本身较少直接进入了但它代表的设计思路仍然值得理解基因组数据天然异构图谱、序列、注释、通路各自结构不同硬塞进关系型表会非常痛苦。在第2章末尾PPT还插入了一片实际序列片段展示的是水稻抗病相关基因OsDR8所在区域的原始序列开头是“gggctccacc actagtaccc …”同时给出G1810.42、L1044、NBS1190.21、RM2240.21、R15060.00、Xa261.47、S12886RM144这批分子标记及图谱距离数据。这是在演示一个真实的数据库条目如何把原始序列与遗传图谱信息放在一起。引申出的实战问题是如果你在一篇文献里看到“OsDR8”想知道它对应的注册号、基因注释和物理位置该去哪查这就是下一章GenBank的内容。3. GenBank实战flatfile结构、三种标识与16个分支的用法3.1 三大核苷酸数据库与GenBank的规模国际上三大核苷酸数据库是GenBank、EMBL核苷酸数据库和DDBJ三者在国际核苷酸序列数据库合作协议框架下以天为基础交换序列数据信息共享。换句话说无论你把序列提交到其中哪一个另外两个都会在几天内同步到同一条记录只是在本地拥有不同的格式偏好和编号体系。提交专利的核苷酸序列也由合作机制一并收集来源包括美国专利商标局USPTO、欧洲专利局EPO、日本专利局JPO。如果你处理的是专利相关序列要意识到它们已经混入常规release中检索时要留意PAT分支。GenBank是NCBI的数据库里面也收纳部分蛋白质序列。更新节奏是“数据每天更新每年发行六版”。PPT给出的Release 185是理解规模的一把尺子142,284,608条序列碱基数bases达到千亿量级loci同为1.4亿级别下载全部序列大约需要511 GB。PPT里附了一张“Growth of GenBank (1982- )”的变化曲线直观展示了序列量与条目数从八十年代至今的陡峭增长。这个数字对实际工作意味着什么第一单机全量下载不现实按需检索才是常态第二物种覆盖超过500,000个其中约12.2%来自Homo sapiens人类序列是当之无愧的最大来源之一。在做同源比对时如果你不做物种过滤结果里会混入大量人类序列的冗余命中需要严格控制过滤条件。3.2 flatfile与三种标识符Locus name、Accession number、GI每条GenBank序列对应一个flatfile。flatfile以成对的关键字—内容行组织从LOCUS开始到“//”结束中间按FEATURES、ORIGIN等段落展开原始序列出现在ORIGIN之后。判断一条flatfile是否完整先看结尾有没有“//”再看每个关键字的缩进是否符合规范这是我处理NCBI导出文件时最先检查的两项。每条序列有三个专有编号或标识符identifier它们的用途完全不同标识符全称稳定性用途Locus name位点名可变可能重复记录识别历史命名Accession number注册号或登陆号稳定唯一文献引用、投稿定位GIGenInfo identifier随序列修订变化NCBI内部版本追踪Locus name是一个短名称历史上承载物种与分支信息但现在更多是人为指定的记录名长度有限制它不等于注册号不能保证全局唯一。Accession number才是稳定、唯一的ID写论文、引文献、向数据库提交序列后获得的号就是它。GI是纯数字内部标识符由NCBI内部维护序列内容一旦变化GI就会变所以同一个Accession可能对应多个GI版本。注意写论文时引用序列请用Accession number不要用GI也不要只写Locus name。GI会随更新变位点名可能重复注册号才是可复现的凭证。3.3 16个分支division检索时先缩小范围GenBank按来源把序列分进16个分支divisions每个分支用三个字母的缩写标识。这张表直接决定了你检索时的过滤策略缩写分支全称缩写分支全称PRI灵长类序列SYN合成序列ROD啮齿类序列UNA未注释序列MAM其它哺乳类序列EST表达序列标签VRT其它脊椎动物序列PAT已专利序列INV无脊椎动物序列STS序列标签位点PLN植物、真菌和海藻类序列GSS基因组调查序列BCT细菌序列HTG高通量基因组序列VRL病毒序列HTC高通量cDNA序列PHG噬菌体序列这个分支体系是理解检索结果的过滤器。实操里最常见的用法是检索水稻基因时把范围限定在PLN分支避免命中其他物种检索某个病毒基因时直接在VRL分支内查询命中率和信噪比都会好很多。把EST单列一个分支是因为它数量太大、质量参差单独放置方便人们在常规序列与表达序列之间做取舍。PAT分支收录已专利序列涉及知识产权核查时要在这一分支里单独检索——比如你的引物序列是否已被他人专利覆盖这是分子育种和产业化项目里常被忽略的一步。另一个容易被忽略的事实GenBank里大约64%以上的序列是EST意味着如果检索时不过滤分支结果里一大半可能是单次测序的短表达序列而非完整基因。这直接导致“检索到序列但序列质量不高”的问题。后文会专门讲这一点。3.4 投稿前的序列提交流程PPT在开头就点明一个科研规范投稿文章前必须先将核苷酸或蛋白质序列提交到相应数据库。这不是形式要求而是期刊的硬性规定也是主流杂志对“数据可用性”的通行要求。常见做法是整理序列的物种来源、克隆载体、测序方向和注释信息。到NCBI的BankIt或序列提交工具填写元数据。获得Accession number写进论文。核对release版本号确保与文稿引用的版本一致。论文返修期间序列如有更新用“revised”方式提交保留原有注册号。这套流程里最容易翻车的是注释部分提交时必须填CDS区域、基因名和功能描述填得马虎数据库管理人员会打回修改且每个循环都可能耗时数天。如果你只是复现别人的分析不打算投稿就可以跳过这里直接进入下一步如何在GenBank里检索你要的基因。4. 二级数据库检索与避坑dbEST、UniGene、dbSTS、dbGSS的用法边界4.1 dbEST表达序列标签库质量与数量并存dbEST是GenBank的二级数据库专门收录ESTExpressed Sequence Tags。EST本质上是cDNA序列的一个片断可以来自5端、3端或CDS区域长度通常在300到400 bp属于single-pass sequence单次测序。正因为是单次测序EST的碱基错误率明显高于精心注释过的常规序列所以在用它做比对、设计引物或拼装时必须接受“有噪音”的前提。GenBank中64%以上的序列是EST这是一个被反复引用的统计。它意味着你在GenBank直接按关键词检索时很容易被EST淹没。实用对策是先确定自己需要的是“完整基因mRNA/gene”还是“表达证据EST”。需要完整基因时优先用Gene数据库或限定mRNA来源来过滤。需要表达证据时检索dbEST并使用表达序列标签的专用分类。EST还有别的用途用不同组织来源的EST做数字表达分析是常见做法特定EST在某个cDNA文库中出现的频次可以粗略反映基因在该组织里的表达水平。这套PPT在检索层面把dbEST的定位讲得比较清楚——它是二级数据库是GenBank的一个分区而不是独立的跨库搜索引擎。4.2 UniGene与dbSTS从基因群到染色体定位UniGene是NCBI的另一个核苷酸数据库核心思路是把来源于同一基因的非重复EST组成基因序列群gene cluster。目前覆盖人、大鼠、小鼠、斑马鱼、牛、蛙等动物还包括拟南芥、水稻、小麦、大麦、玉米等植物PPT里提到共97个物种。它的价值在于把海量EST归并到“基因”这个层级让你不必在一堆冗余片段中挣扎。UniGene的实际检索方式很简单建议直接在NCBI的UniGene主页输入关键词比如“OsDR8 rice”配合物种过滤器得到的是一个基因群条目里面包含基因名称、所属物种、序列成员列表、表达谱和同源信息。这一步比在GenBank全库里搜OsDR8干净得多。dbSTSDatabase of Sequence Tagged Sites则是GenBank的另一个二级数据库收录STS一类长度在200到500 bp、已定位于染色体上的单拷贝DNA短片段。STS最大的意义在于作为物理图谱的路标把遗传图谱、物理图谱和序列组装串起来。PPT里给出的检索路径是在GenBank主页选择UniSTS后输入关键词返回的每个条目可在详情页查看染色体定位。比如水稻抗病基因OsDR8附近的一系列分子标记RM224、RM144、Xa26等都能在STS或标记数据库里定位到具体染色体区间。做图位克隆和标记辅助选择时这一套检索流程非常常用。4.3 dbGSS与高通量数据来源决定一切dbGSSGenome Survey Sequences与EST非常相似连NCBI自己的定义都在强调两者类似。但本质区别在来源EST来自cDNAmRNA反转录产物GSS来自基因组DNA。GSS通常由做基因组测序的实验室提交给NCBI用途是作为基因组物理图谱和测序框架。cosmid、BAC、YAC这类克隆载体的末端序列往往以GSS形式进入数据库。这意味着如果你要的是“某一基因在基因组里的侧翼序列”GSS是很好的线索源如果你要做的是基因表达分析GSS完全不适用的。很多初学者看到“survey sequence”就以为是表达序列这是对二级数据库命名最普遍的误解。判断规则很简单——看来源cDNA就是表达证据genomic DNA就是结构证据。HTGhigh throughput genomic sequences和HTChigh throughput cDNA sequences也在这个体系里对应高通量产出、尚未完成注释的序列。它们通常比较“原始”可能在后续版本里被重注释甚至拆分。使用这类序列时记得在方法部分写清楚使用的是哪一版release。4.4 常见问题与避坑五个高频翻车现场下面这几条都是我在实际检索和带人的过程中反复遇到的每一条都按现象、原因、解决记录。坑1检索结果里全是EST找不到完整的基因序列现象在GenBank里输入基因名检索返回几百条结果点开看都是300 bp左右的短序列找不到想要的mRNA全长。原因没有过滤分支GenBank总量里EST占比超过64%关键词匹配很容易命中大量EST。解决先限定division为PRI、PLN等目标分支或改用NCBI Gene、UniGene入口检索拿到Gene ID后再转mRNA序列绕开EST噪音。坑2论文里只写了GI号审稿人要求补Accession number现象返修意见要求提供sequence accession作者对着GI号找不着对应关系。原因GI是NCBI内部版本标识会随序列修订变化不是期刊认可的标准凭证。解决回到GenBank flatfile的ACCESSION行取第一个稳定的注册号写入论文同时注明检索日期和release版本。坑3从一年前的导出文件里复现比对序列对不齐现象去年下载的序列与当前版本记录一致但复现比对时关键位点不一致。原因GenBank每天更新注释和序列可能被作者修正旧的flatfile过期。解决复现实验的关键序列重新在NCBI核验一次注册号对应的当前版本在方法部分写清“检索于XXXX年XX月GenBank Release XXX”。坑4用MySQL管理序列后发现文本损坏现象把FASTA、GenBank文本直接灌进MySQL读出来换行符丢失、序列断行错乱。原因没有设置合适的字符集和换行处理直接用TEXT字段存原始格式。解决规范做法是只把元数据拆字段入库序列以FASTA文件落盘DB里只存注册号与文件路径如必须存长文本选LONGTEXT并用显式换行符。坑5检索植物基因时跑出大片人类序列现象BLAST或关键词检索后高分段全是human mRNA目标植物序列排在很远。原因没有做物种过滤而人类序列在总库中约占12.2%且注释质量高、命中常优先。解决在NCBI Entrez检索式里加物种字段例如“OsDR8[All Fields] AND Oryza sativa[Organism]”把人源结果挡在门外。注意以上五条看似零散其实指向同一个底层能力——检索前先想清楚“我到底要什么类型的序列”再决定用哪个数据库入口和哪个分支、物种过滤器。工具是次要的筛选逻辑才是检索的命门。5. 把PPT变成自己的检索手册一条基因的完整验证流程这套PPT的知识密度不低但如果只是从头到尾看一遍一周后多半只剩个模糊印象。我的做法是把它当作操作手册拿一个具体的基因走一遍全流程边看边动手最后把每一步的操作痕迹留下来。这套127页的PPT正好可以作为这份对照手册的原始底稿建议先把它保存到本地边检索边翻页核对。具体来说我强烈建议你拿PPT里反复出现的水稻抗病相关基因OsDR8当实验对象完成下面这条验证链路。第一步打开NCBI在检索框输入“OsDR8[Gene Name] AND Oryza sativa[Organism]”确认Gene入口下能查到该基因条目及其Gene ID。第二步从Gene页面点进Nucleotide找到对应的完整mRNA序列记录它的Accession number。第三步用这个Accession number去查看它的flatfile对照PPT里讲的字段找到LOCUS行、ACCESSION行、FEATURES区的CDS注释验证Locus name、Accession和GI三者是否与前面的表格对应。第四步回到PPT里那240 bp的序列片段用NCBI的BLASTn短序列比对工具把它贴进去看它能否精确匹配到你刚找到的那条完整序列。如果匹配度达到100%说明你对flatfile结构的理解是对的这套PPT的示例数据也经得起验证。做完这一步再额外做一个反向练习用UniGene和dbSTS分别查一次OsDR8或它附近的分子标记比如RM224把从不同入口得到的结果记录到同一张表里检索入口关键词期望返回序列类型用途GeneOsDR8 rice基因条目注释信息获取Gene IDNucleotideOsDR8 mRNA全长序列mRNA获取AccessionUniGeneOsDR8 rice基因群cluster成员表达归属UniSTS / STSRM224分子标记STS染色体定位这张表做完你对“生物信息学数据库不是单一检索框而是一套彼此链接的检索网络”这件事就有了身体记忆而不是只在PPT上看过结论。讲讲我自己的血泪经验第一次给学生布置这个练习时我自己先踩了坑。我在UniGene里输入“OsDR8”结果返回的是人源UniGene条目当时吓了一跳。后来才意识到UniGene是分物种展示的必须先在页面左上角选定rice物种否则关键词匹配会优先把你带到别的物种。从那以后我每次检索前都强制自己先走一遍“物种→数据库入口→关键词→分支过滤”四步检查再点检索按钮。这套习惯帮我少走了很多弯路也让我在带新人时能直接指出问题出在哪一步。希望帮到你。本文还有配套的精品资源点击获取

相关新闻

Canon EDSDK 13.11.0 开发实战:RAW直采与LiveView低延迟控制

Canon EDSDK 13.11.0 开发实战:RAW直采与LiveView低延迟控制

简介:本资源为佳能官方发布的EDSDK电子开发套件13.11.0正式版,面向C#、Visual C及Visual Basic开发者,用于深度集成与控制佳能数码相机,广泛应用于专业摄影软件、自动化拍摄系统、图像采集平台等场景。压缩包共179个文件&#xff…

2026/10/11 20:16:05 阅读更多 →
181 个许可可核验的免费素材站:视频 / 图片 / 字体 / 3D 避开版权索赔

181 个许可可核验的免费素材站:视频 / 图片 / 字体 / 3D 避开版权索赔

太长不看:本文给出「免费素材」的核验方法论(下载前自查三问)+ 93 个无需署名、无需注册、可放心用于货币化内容的素材站分类表格 + 一份 181 个资源、每周 CI 自动检查全部链接的开源清单。 一、为什么「免费素材」总…

2026/10/11 20:16:05 阅读更多 →
基于STM32与华为云IOT的养殖场环境监测系统设计

基于STM32与华为云IOT的养殖场环境监测系统设计

简介:本资源是一份基于STM32的养殖场环境监测系统完整项目文档,面向物联网、嵌入式开发学习者及毕业设计开发者,帮助解决环境参数采集、远程监控与智能控制等实际问题。文档以STM32F103RCT6为主控,整合SHT30温湿度、MQ135空气质量…

2026/10/11 20:15:03 阅读更多 →

最新新闻

HyperQwen int8 张量核实战:修复 Marlin W4A8 负缩放 bug 并逐层选择激活量化

HyperQwen int8 张量核实战:修复 Marlin W4A8 负缩放 bug 并逐层选择激活量化

HyperQwen int8 张量核实战:修复 Marlin W4A8 负缩放 bug 并逐层选择激活量化 【免费下载链接】HyperQwen Serve large Qwen models fast on the GPUs you actually own. Qwen3.8-27B on a single 24 GB card with vLLM: 127 tok/s single-user (381 when the answe…

2026/10/11 20:55:42 阅读更多 →
VC++双人对决围棋程序:规则与界面实现全解析

VC++双人对决围棋程序:规则与界面实现全解析

简介:一份可以直接编译运行的VC双人围棋对弈程序源码,基于MFC设计,面向刚开始学习VC或对游戏编程感兴趣的开发者。程序支持双人在同一台电脑上轮流落子,自动完成棋盘绘制与胜负判断,并针对15/17寸液晶屏幕提供了窗口尺…

2026/10/11 20:55:42 阅读更多 →
HaleHound-CYD首次启动指南:触屏校准、屏幕旋转与5个常见故障快速排查

HaleHound-CYD首次启动指南:触屏校准、屏幕旋转与5个常见故障快速排查

【免费下载链接】HaleHound-CYD ESP32-DIV HaleHound Edition for Cheap Yellow Display - Multi-protocol offensive security toolkit 项目地址: https://gitcode.com/gh_mirrors/ha/HaleHound-CYD 点击查看 免费下载 HaleHound-CYD 是运行在 ESP32 Cheap Yellow…

2026/10/11 20:55:42 阅读更多 →
五台山景点购票系统:分时预约与防超卖技术方案

五台山景点购票系统:分时预约与防超卖技术方案

简介:这份PPT资源面向计算机专业学生与Java Web开发者,围绕五台山景点购票系统的设计与实现展开,可作为毕业设计、课程设计或SSM框架学习项目的参考方案。内容涵盖系统背景、需求分析、SSM框架选型、管理员与用户功能模块划分、系统测试及结论…

2026/10/11 20:55:42 阅读更多 →
基于模拟退火的VRPSPD求解及Matlab实现——同时取送货车辆路径问题

基于模拟退火的VRPSPD求解及Matlab实现——同时取送货车辆路径问题

1. 项目概述:这是一个什么问题先聊一个做配送调度的朋友几乎都遇到过的情况:快递员早上出门装满一车货,沿途把包裹送出去,同时还要把用户退的旧件、要寄出的箱子一件件收回来。车上的货物量不是在消耗,而是在动态变化—…

2026/10/11 20:55:42 阅读更多 →
google/ax 点名依赖之后:agent 基建下半场,沙箱层开始卷了

google/ax 点名依赖之后:agent 基建下半场,沙箱层开始卷了

google/ax 点名依赖之后:agent 基建下半场,沙箱层开始卷了 【免费下载链接】substrate Agent Substrate: the core system 项目地址: https://gitcode.com/GitHub_Trending/substrate7/substrate agent 生态的竞争重心正在肉眼可见地下移&#xf…

2026/10/11 20:54:41 阅读更多 →

日新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 10:45:37 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:53 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:54 阅读更多 →