人工智能深度学习计算机视觉NLP语音【免费下载链接】modelsOfficially maintained, supported by PaddlePaddle, including CV, NLP, Speech, Rec, TS, big models and so on.项目地址https://gitcode.com/gh_mirrors/mo/models点击查看免费下载本文围绕飞桨模型库PaddlePaddle models社区模型emilyalsentzer/Bio_Discharge_Summary_BERT的中文下载指南展开完整给出该 ClinicalBERT 衍生模型的权重文件清单、两种获取方式直连文件下载与paddlenlp命令行下载并结合仓库中的模型元数据与介绍 Notebook 说明如何在 PaddleNLP 中加载该模型完成前向推理读完后可直接完成该模型的落地使用。一、模型背景Bio Discharge Summary BERTemilyalsentzer/Bio_Discharge_Summary_BERT是 ClinicalBERT 系列模型中的Bio Discharge Summary BERT Model其来源与任务定位可从仓库中的元数据文件确认模型描述descriptionClinicalBERT - Bio Discharge Summary BERT Model发布者Publisher为 emilyalsentzer语言为英文Language: English授权协议为 MITLicense: mit任务标签为「自然语言处理 / Fill-Mask槽位填充」与 BERT 掩码语言模型MLM预训练目标一致关联论文为Publicly Available Clinical BERT EmbeddingsarXiv:1904.03323与 *BioBERT: a pre-trained biomedical language representation model for biomedical text mining*arXiv:1901.08746。以上信息记录在 模型元数据文件 中。从 中文介绍 Notebook 的正文可以进一步了解该模型在 ClinicalBERT 系列中的位置原论文共发布了四个 clinicalBERT 模型其差异由两个维度交叉组合而成——初始化底座BERT-Basecased_L-12_H-768_A-12或 BioBERTBioBERT-Base v1.0 PubMed 200K PMC 270K训练语料MIMIC 全部病历文本all MIMIC notes或仅出院小结discharge summaries。本模型即「以 BioBERT 初始化、仅在 MIMIC 出院小结上训练」的这一支。Notebook 末尾同时注明该模型介绍及权重来源于 Hugging Face 同名模型卡并已转换为飞桨模型格式后收录进本仓库这也是下文下载文件以 PaddlePaddle 权重文件.pdparams为准的原因。二、模型文件清单与大小原文档给出的模型列表如下四个文件共同构成可被 PaddleNLP 加载的完整模型目录模型名称模型介绍模型大小模型下载emilyalsentzer/Bio_Discharge_Summary_BERTClinicalBERT - Bio Discharge Summary BERT Model500.52MBmodel_config.jsonmodel_state.pdparamstokenizer_config.jsonvocab.txt四个文件的分工可以这样理解model_state.pdparamsPaddlePaddle 格式的全部模型权重主体部分模型约 500.52MB 的体积主要由它贡献model_config.json模型结构配置AutoModel.from_pretrained依据它还原网络结构tokenizer_config.json与vocab.txt分词器配置与词表加载AutoTokenizer时依赖二者沿用 BERT 系英文词表格式。如果只需手动下载文件可依次访问上表中对应 URL 获取并建议将四个文件放置在同一目录下便于后续用本地路径直接加载。三、方式一直连 URL 下载各文件即上表「模型下载」列所列的四个直连地址。这种方式适合需要精确控制文件落盘位置、或希望单独校验某一文件例如只检查词表的场景。下载完成后请确认目录结构与模型名称一致例如./pretrained_models/emilyalsentzer/Bio_Discharge_Summary_BERT/ ├── model_config.json ├── model_state.pdparams ├── tokenizer_config.json └── vocab.txt四、方式二使用 paddlenlp CLI 下载模型权重原文档推荐的方式是通过paddlenlp提供的命令行工具一键拉取整个模型目录共两步第 1 步安装或升级PaddleNLPpip install --upgrade paddlenlp第 2 步执行下载命令paddlenlp download --cache-dir ./pretrained_models emilyalsentzer/Bio_Discharge_Summary_BERT命令中的各部分含义如下paddlenlp downloadPaddleNLP 内置的模型下载子命令支持按「命名空间/模型名」形式定位模型--cache-dir ./pretrained_models指定模型缓存目录本例为当前目录下的./pretrained_models下载完成后模型会按emilyalsentzer/Bio_Discharge_Summary_BERT的层级存放在该缓存目录下末尾的emilyalsentzer/Bio_Discharge_Summary_BERT待下载的模型名称与 模型元数据文件 中的name字段严格一致。使用 CLI 下载的好处是无需关心具体由哪些文件组成命令会自动补齐完整的模型目录这也与仓库中其他社区模型例如同发布者的 Bio_ClinicalBERT 下载文档采用的统一下载范式保持一致。若下载过程中遇到问题原文档建议到 PaddleNLP 官方仓库提交 Issue 咨询。五、下载后如何加载模型下载完成后可直接使用paddlenlp.transformers.AutoModel按模型名加载首次加载时会自动触发缓存/下载逻辑。仓库 中文介绍 Notebook 中给出的官方用法如下import paddle from paddlenlp.transformers import AutoModel model AutoModel.from_pretrained(emilyalsentzer/Bio_Discharge_Summary_BERT) input_ids paddle.randint(100, 200, shape[1, 20]) print(model(input_ids))说明AutoModel.from_pretrained以模型名emilyalsentzer/Bio_Discharge_Summary_BERT定位权重与配置若已通过前文 CLI 下载到本地也可改为传入本地目录路径示例中input_ids使用paddle.randint(100, 200, shape[1, 20])生成一批随机 token id取值 100~200 均在英文 BERT 词表范围内仅用于打通前向链路、验证模型可正常加载与推理实际业务中应先用配套的AutoTokenizer将出院小结等临床文本分词为真实input_ids再送入模型由于该模型的预训练目标是掩码语言模型Fill-Mask 任务标签见 info.yaml其输出适合用作下游 NLP 任务如临床文本分类、命名实体识别的文本表示底座。六、同系列模型对照与延伸阅读在modelcenter/community目录下同发布者emilyalsentzer还提供另一个 Community 模型emilyalsentzer/Bio_ClinicalBERT其文件清单、大小同为 500.52MB与下载流程完全一致对应的是「BioBERT 初始化 全量 MIMIC 病历文本训练」这一支两个模型的下载与加载方式可互为对照Bio_Discharge_Summary_BERT 下载文档本文对应Bio_Discharge_Summary_BERT 介绍 NotebookBio_ClinicalBERT 下载文档飞桨模型库使用指南综上按照本文的清单核对、CLI 下载与AutoModel.from_pretrained加载三步即可完成该 ClinicalBERT 出院小结模型在 PaddleNLP 中的获取与验证并可在此基础上开展下游临床文本挖掘任务。赞分享人工智能深度学习计算机视觉NLP语音【免费下载链接】modelsOfficially maintained, supported by PaddlePaddle, including CV, NLP, Speech, Rec, TS, big models and so on.项目地址https://gitcode.com/gh_mirrors/mo/models点击查看免费下载相关推荐EMQX 会话过期时间上限收敛DISCONNECT 报文中的 Session Expiry Interval 钳制机制解析EMQX 会话过期时间上限收敛DISCONNECT 报文中的 Session Expiry Interval 钳制机制解析 导读 本篇文章聚焦 EMQX 对人工智能深度学习计算机视觉NLP语音Kata Containers Go 包体系解析从 src/runtime/pkg 看运行时与 shim 的共享工具库Kata Containers Go 包体系解析从 src/runtime/pkg 看运行时与 shim 的共享工具库 Kata Containers 的 G人工智能深度学习计算机视觉NLP语音飞桨社区模型库全景指南470 社区贡献模型的目录结构、复现标准与使用路径飞桨社区模型库全景指南470 社区贡献模型的目录结构、复现标准与使用路径 飞桨PaddlePaddle生态中的社区模型库收录了 470 由开发者与高校人工智能深度学习计算机视觉NLP语音上一篇洛雪音乐音源配置终极教程免费打造全网音乐聚合方案下一篇OpCore-Simplify5分钟搞定黑苹果EFI配置的终极开源工具创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考