Hugging Face数据集加载安全风险与三层隔离防御实战
1. 从一次“无害”的模型下载说起信任边界的崩塌那天下午团队里一位刚接触大模型应用开发的新同事在本地调试一个文本摘要的Demo。为了快速验证效果他直接从Hugging Face Hub上拉取了一个热门的中文摘要模型。脚本再简单不过几行transformers库的代码模型名称填进去pipeline一加载任务就完成了。整个过程丝滑顺畅直到半小时后我们的内部监控系统开始报警——有几台开发机的CPU使用率异常飙升并且出现了可疑的外网连接尝试。排查的源头最终指向了那个刚刚下载的模型文件。这听起来像是个危言耸听的故事但却是基于真实攻击模式推演出的、极有可能发生的场景。我们通常认为从Hugging Face这样的知名平台下载一个开源模型或数据集就像从应用商店安装一个经过审核的App一样安全。然而这个认知在AI供应链安全面前正变得异常脆弱。问题的核心远不止于模型权重文件本身是否被植入恶意代码而在于一个更隐蔽、更致命的环节Dataset Processing数据集处理。当你执行from datasets import load_dataset时或者当transformers的AutoTokenizer在加载模型时自动去下载对应的词表文件背后触发的一系列数据处理流水线才是信任链条上最薄弱的一环。攻击者无需直接毒化一个庞大的模型文件这很容易被哈希校验发现他们只需要精心构造一个数据集配置文件如dataset_infos.json或是一个数据处理脚本如dataset.py中的_generate_examples函数在其中嵌入恶意代码。当你的代码信任地执行了这些来自互联网的脚本时攻击的“第一颗棋子”就已落下。这次事件模拟暴露的正是AI开源生态中一个被严重低估的信任边界问题。我们信任平台信任开源贡献者却自动执行了来自这些渠道的、未经沙箱隔离的任意代码。本文将深入拆解这条基于Dataset Processing的攻击链剖析为何传统的安全隔离在此失效并提供一个从理论到实践、涵盖“预防-检测-响应”的三层隔离加固方案与可立即执行的安全行动清单。2. 攻击链深度拆解恶意数据集如何“四两拨千斤”要防御攻击首先必须像攻击者一样思考。针对Hugging Face Datasets库的攻击链其精妙之处在于“借力打力”利用的是生态本身的自动化机制和用户的绝对信任。我们将其分解为四个关键阶段。2.1 阶段一投毒载体——配置与脚本的伪装攻击的起点不是模型而是一个数据集仓库。攻击者会创建一个看似正常的数据集例如一个用于情感分析的英文影评集。其仓库结构看起来人畜无害my_malicious_dataset/ ├── README.md ├── data/ │ └── train-00000-of-00001.parquet └── dataset_infos.json真正的武器藏在dataset_infos.json这个配置文件中。该文件用于定义数据集的分割、特征等信息但其中有一个关键字段splits。在splits的定义中可以指定一个generator这个generator指向一个本地Python函数。攻击者可以这样构造{ my_dataset: { splits: { train: { num_examples: 1000, generator: { function: _generate_examples_with_backdoor, file: dataset.py } } } } }或者更直接地在dataset.py文件中定义数据加载逻辑时在_generate_examples函数内部写入恶意代码。由于datasets库在加载数据时会动态导入并执行这个dataset.py文件恶意代码就此获得了执行上下文。注意这种攻击之所以高效是因为数据集文件本身如parquet、csv可以是完全干净、有效的。安全扫描工具检查文件内容时一无所获但执行路径却被配置文件“劫持”了。2.2 阶段二触发执行——自动化流水线的信任滥用当用户运行load_dataset(attackers-org/my_malicious_dataset)时攻击链被自动触发。datasets库的工作流程如下从Hub下载仓库元数据和配置文件。解析dataset_infos.json发现需要调用本地dataset.py中的函数来生成数据。动态导入dataset.py模块。就在这个导入过程中模块顶层的任何代码包括函数定义外的代码都会立即执行。执行指定的_generate_examples_with_backdoor函数。关键在于第3步。攻击者根本不需要等待数据生成函数被调用。他们只需在dataset.py的顶层写下这样的代码import os, subprocess, sys # 检查当前是否在沙箱或分析环境中 if not os.path.exists(/tmp/security_sandbox): # 第一阶段信息收集 exfil_data { env: dict(os.environ), cwd: os.getcwd(), files: os.listdir(.) } # 通过DNS或隐蔽HTTP通道外传数据 # ... # 第二阶段持久化或横向移动 # 例如写入定时任务或尝试连接内部服务 # ...这段代码在模块导入的瞬间就已执行防不胜防。2.3 阶段三载荷执行——从信息收集到持久化恶意代码一旦执行其目标通常是多层次的环境侦察收集环境变量、进程列表、网络配置、云元数据端点信息判断当前所处环境是开发机、CI/CD流水线还是生产容器。凭证窃取扫描~/.aws/~/.kube/config~/.git-credentials等文件窃取云服务凭证、Kubernetes集群权限或代码仓库令牌。建立持久化根据环境下载第二阶段的植入物。在Linux下可能写入crontab或systemd服务在CI环境中可能篡改流水线脚本在容器内可能修改入口点脚本。横向移动利用窃取的凭证尝试访问同一网络内的其他服务如数据库、内部API、版本控制系统等。2.4 阶段四隐蔽外联——数据渗出与命令控制攻击者会使用极其隐蔽的通信方式以绕过网络监控DNS隧道将窃取的数据编码成子域名查询请求例如{base64_data}.malicious-domain.com。HTTPS over 常用端口使用443端口与伪装成正常CDN或云存储的服务端通信。社交媒体或代码平台API将数据分割后通过伪造的请求发送到Twitter、GitHub Gist等公开服务的API这些流量通常不会被企业防火墙完全阻断。整个攻击链从一次看似合法的load_dataset()调用开始到内部网络失陷结束全程自动化且利用了生态工具本身的最高权限。这比直接攻击模型权重要容易得多因为数据处理的动态代码执行特性打开了一扇本不该存在的“后门”。3. 三层隔离防御体系构建纵深安全防线面对这种供应链攻击单点防御是无效的。我们必须建立一个从外部到内部、从静态到动态的纵深防御体系。我将其总结为“三层隔离”模型网络层隔离、运行时层隔离和流程层隔离。3.1 第一层网络隔离与访问控制这一层的目标是尽可能阻止恶意代码与攻击者控制端的通信同时限制内部横向移动的能力。1. 严格的出站网络策略Egress Filtering默认拒绝所有计算环境开发机、训练集群、CI Runner的出站流量应默认禁止只开放明确允许的清单。白名单制仅允许访问必要的服务。对于AI开发通常包括huggingface.co(用于模型/数据集下载)pypi.org及镜像站 (用于Python包)内部私有包仓库操作系统更新源禁止直接外联互联网考虑通过一个经过严格审查的HTTP代理来访问外部资源该代理应具备内容过滤和恶意域名拦截功能。2. 网络分段与微隔离将AI开发环境、训练环境、模型部署环境置于不同的网络VLAN或安全组中。开发机不应直接访问生产数据库或Kubernetes控制平面。训练任务集群应独立成网。使用服务网格或主机防火墙策略实现即使在同一网络内也只有必要的服务端口可以互通。3. DNS安全监控强制所有DNS查询通过内部DNS服务器并部署DNS安全解决方案。监控并告警异常的DNS查询模式例如对大量随机子域名的查询可能是DNS隧道特征。3.2 第二层运行时隔离与沙箱化这是最核心的一层旨在确保不可信的代码在一个受限的环境中执行即使它被加载也无法造成实际危害。1. 强制使用离线模式与本地镜像最佳实践彻底禁止在关键环境如CI/CD、生产数据处理流水线中直接从Hugging Face Hub动态下载数据集。应建立内部的数据集仓库。操作流程在一个专用的、隔离的“下载与审查”环境中使用huggingface-cli download或git lfs将所需的数据集完整下载到本地。对该数据集仓库进行静态扫描后文详述。将纯净的数据集文件仅数据文件如.parquet、.jsonl移除dataset.py等脚本上传到内部文件存储或制品仓库。在业务代码中使用load_dataset的data_dir或data_files参数从本地文件路径加载数据完全绕过在线脚本执行。# 不安全的方式 dataset load_dataset(attackers-org/my_malicious_dataset) # 安全的方式 dataset load_dataset(json, data_files./internal_repo/my_dataset/train.jsonl)2. 沙箱化代码执行环境对于无法避免需要执行外部数据处理脚本的场景例如使用社区中某些必须依赖自定义脚本的数据集必须将其置于沙箱中。使用系统级容器隔离在Docker容器内运行数据加载步骤。使用--read-only挂载根文件系统仅以只读方式挂载必要的数据卷。使用--cap-dropALL移除所有Linux能力并使用--security-opt no-new-privileges防止提权。严格限制容器内的用户权限以非root用户运行。docker run --rm \ --read-only \ --cap-dropALL \ --security-opt no-new-privileges \ --user 1000:1000 \ -v $(pwd)/clean_data:/data:ro \ -v $(pwd)/script:/script:ro \ my-python-image python /script/load_data.py使用语言级沙箱对于Python可以考虑使用PyPy的沙箱功能但配置复杂且生态支持有限。更实用的方法是使用restrictedpython等库创建一个白名单式的安全执行环境只允许访问指定的内置函数和模块如list,dict,range禁止访问os,subprocess,sys,socket等危险模块。你需要自定义_generate_examples函数的执行器。3. 资源限制与监控使用ulimit或容器资源限制严格控制数据处理进程的CPU、内存、进程数和文件描述符使用量。使用strace、ptrace或eBPF工具监控进程的系统调用实时检测异常行为如尝试执行execve、connect、open写敏感文件等。3.3 第三层流程隔离与安全左移将安全措施嵌入到开发和运维的每一个环节形成制度化的保障。1. 数据集入库强制安全扫描 建立内部数据集仓库的准入流程。所有从外部引入的数据集必须经过扫描静态代码分析使用Bandit、Semgrep等工具扫描dataset.py及所有相关Python脚本查找危险函数调用如os.system,eval,pickle.loads。配置审计自动解析dataset_infos.json、config.json等检查是否存在指向外部URL的generator脚本或可疑的加载参数。文件哈希白名单对通过审查的数据集文件计算哈希值在线上环境加载时校验实际下载文件的哈希值是否与白名单匹配。2. 最小权限原则贯彻始终运行账户隔离数据处理、模型训练、服务部署应使用不同的系统账户每个账户仅拥有完成其任务所需的最小权限。凭证动态管理禁止在环境变量或代码中硬编码长期有效的凭证。使用类似HashiCorp Vault的解决方案为每个任务动态签发短时效的令牌。文件系统权限控制数据处理进程的工作目录应设置为不可执行挂载点并限制其写入权限。3. 不可变基础设施与一次性的执行环境无论是CI/CD流水线中的数据处理步骤还是定期的数据预处理任务都应在一个全新的、从干净镜像启动的容器中运行。任务完成后容器立即销毁。任何由任务产生的、需要持久化的数据只允许写入指定的、受监控的输出卷。这确保了即使单次任务被污染也不会感染后续任务或主机环境。这三层隔离并非并列选择而是需要叠加使用。网络层减少了攻击的影响范围运行时层遏制了攻击的执行能力流程层则从源头降低了风险。它们共同构成了针对Dataset Processing攻击的立体防御网。4. 实战行动清单从今天起可落地的十项安全加固理论需要付诸实践。以下是我根据自身经验总结的、可立即开始实施的安全行动清单按优先级排序。4.1 立即执行24小时内审查并锁定依赖版本检查所有项目的requirements.txt或pyproject.toml将datasets和transformers库的版本固定到已知稳定的次要版本例如datasets2.15.0避免自动升级到可能引入未知变化的新版本。启用HF_TRANSFER_OFFLINE模式在关键环境CI/CD、生产数据处理中设置环境变量HF_TRANSFER0。这可以防止一些后台多线程下载行为可能带来的潜在风险强制使用更简单的下载逻辑。建立数据集代理或镜像配置HF_ENDPOINT环境变量指向一个企业内部搭建的Hugging Face镜像站或经过安全审计的代理服务。这是实现网络层白名单控制的第一步。4.2 短期实施1周内实施离线数据集加载选择一个核心项目将其依赖的数据集迁移到离线加载模式。编写脚本在安全环境中预先下载数据集文件仅数据文件存入内部MinIO/S3或NFS修改代码从本地路径加载。将此模式作为新的代码规范。在CI中集成基础安全扫描在CI流水线中增加一个安全检查步骤。使用bandit -r .扫描项目代码并使用一个简单的脚本检查load_dataset调用是否使用了不可信的、来自公共Hub的“组织/数据集名”格式对这类用法发出警告。制定数据集使用安全规范起草一份简短的内部文档明确规定禁止在生产相关环境动态加载社区数据集。所有外部数据集必须先进入“沙箱审查环境”进行静态扫描和动态行为分析在隔离容器中试运行。推荐使用data_files参数从受信存储加载数据。4.3 中期建设1个月内搭建数据集静态审查沙箱创建一个专用的Docker镜像包含datasets库和一系列安全扫描工具bandit,semgrep。编写自动化流程当用户提交新数据集入库申请时自动启动该容器下载目标数据集运行静态扫描并尝试在严格限制的网络和资源下执行一次load_dataset监控其系统调用和网络行为生成报告。强化运行时容器安全配置为所有执行数据加载任务的Kubernetes Pod或Docker容器统一添加安全上下文配置。例如在K8s中设置securityContext: runAsNonRoot: true runAsUser: 1000 allowPrivilegeEscalation: false capabilities: drop: [ALL] readOnlyRootFilesystem: true并配合网络策略NetworkPolicy禁止出站流量。建立凭证管理与审计全面清理项目中硬编码的API Token。推广使用Hugging Face的huggingface-cli login命令将token存储在本地~/.cache/huggingface/token。在服务器环境使用密钥管理服务。同时在Hugging Face账户中定期审计访问日志查看所有令牌的使用情况。4.4 长期演进持续进行推动生态安全实践作为数据集的消费者我们也可以向社区反馈。当你使用一个数据集时如果发现其加载方式过于复杂或存在潜在风险可以向维护者提交Issue建议其提供纯数据文件的版本。同时关注datasets库官方的安全更新和最佳实践指南将安全作为技术选型的一个重要维度。安全是一个持续的过程而非一劳永逸的状态。这份清单提供了一个从易到难、从紧急到长期的行动路径。最关键的是立刻开始第一步改变“默认信任”的心态以零信任的原则对待每一行来自外部的代码和数据。5. 排查、检测与应急响应指南即使防护再严密也需要假设漏洞会发生。当怀疑或确认发生了因恶意数据集导致的入侵时冷静、有序的响应至关重要。5.1 入侵迹象识别以下是一些需要高度警惕的异常信号资源异常非训练时段出现持续的、无法解释的高CPU/内存/磁盘IO使用率特别是与python、datasets相关的进程。网络异常出现到陌生域名尤其是长随机子域名或非常用海外IP的DNS查询和连接尝试。文件系统异常在临时目录、用户目录或容器内发现陌生的可执行文件、脚本或加密文件。进程异常出现未知的python子进程、sh进程或者cron、systemd中增加了陌生任务。日志异常应用日志中出现与数据处理无关的奇怪错误信息或系统日志/var/log/auth.log,journalctl中出现失败的登录尝试、权限变更记录。5.2 应急响应流程一旦确认入侵立即按以下步骤操作立即隔离网络隔离在防火墙上立即阻断受影响主机或容器的所有出站和入站流量除管理通道。主机隔离如果是在虚拟机或物理机上将其从生产网络中移除。如果是在Kubernetes中cordon并drain该Node并删除可疑Pod。保存现场在断电或关闭前尽可能保存易失性证据使用ps auxf,netstat -tunap,lsof命令快照进程和连接内存取证如果条件允许也可考虑。影响评估与溯源确定范围检查所有近期执行过load_dataset任务的系统。审查CI/CD流水线日志、任务调度器历史找出所有加载过可疑数据集的作业。定位源头检查受感染系统的~/.cache/huggingface/datasets目录确定具体是哪个数据集仓库repo_id导致了问题。查看该数据集的dataset_infos.json和dataset.py文件。攻击路径分析分析恶意脚本的行为。它尝试读取了哪些文件尝试连接了哪些内网地址尝试创建了哪些进程或文件这有助于判断数据泄露范围和后续攻击意图。清除与恢复凭证轮转立即轮转所有可能已泄露的凭证包括云服务AK/SK、数据库密码、Git仓库令牌、Hugging Face Token等。环境重建不要尝试在受感染的环境中进行清理。直接废弃受污染的虚拟机、容器镜像或Pod模板。从干净的、经过验证的基础镜像开始重建。数据恢复从安全的备份中恢复被篡改的配置文件或脚本。事后复盘与加固根本原因分析为什么攻击能成功是网络策略缺失、运行时未隔离还是流程审查失效更新前面提到的“三层隔离”策略。更新检测规则将此次攻击的IOC如恶意域名、文件哈希、进程行为特征添加到安全监控系统的检测规则中。团队通告与培训将此次事件作为案例对研发团队进行安全意识培训重申安全规范和操作流程。5.3 日常监控建议为了能更早地发现异常建议部署以下监控进程行为监控使用Auditd或Falco等工具监控execve系统调用特别是由python进程发起的、执行/bin/sh、curl、wget等行为。网络连接监控对所有出站连接进行日志记录并与已知的白名单进行比对分析。文件完整性监控对关键的系统文件和配置文件如/etc/crontab,~/.ssh/authorized_keys进行哈希监控异常变更时告警。集中式日志收集确保所有容器、主机的系统日志和应用日志都汇集到ELK或Loki等集中式日志平台便于关联分析。安全攻防是一场永无止境的博弈。在AI高速发展的浪潮中对供应链安全的重视必须同步提升。将Dataset Processing的信任边界问题暴露出来并非要因噎废食阻止我们使用优秀的开源生态而是为了让我们能更清醒、更安全地利用这些资源。通过建立纵深防御体系和常态化的安全实践我们完全可以在享受开源社区红利的同时将风险控制在可接受的范围内。真正的安全源于对风险的正视和持续、细致的应对。

相关新闻

fail2ban日志管理与封禁IP查询实战指南

fail2ban日志管理与封禁IP查询实战指南

1. fail2ban日志管理核心需求解析fail2ban作为Linux系统最常用的入侵防御工具,其日志文件记录了所有被封禁IP的完整历史。但在实际运维中,我们常遇到几个典型痛点:封禁记录分散在多个日志文件中、实时状态与历史记录混杂、关键信息提取效率低…

2026/8/9 1:02:13 阅读更多 →
KKCE: 全球200+节点的网站测速平台-快快测

KKCE: 全球200+节点的网站测速平台-快快测

一、引言:为什么 HTTP/3 开了,二次访问却没快多少? 在升级 HTTP/3 时,我们常有一个预期:QUIC 的 0-RTT 会话恢复​ 能让老用户重连零握手,跨洋访问直接省掉一个 RTT(150ms)。 只要…

2026/8/9 1:02:13 阅读更多 →
2026年实测:8大宁波周末数学小升初机构综合评测

2026年实测:8大宁波周末数学小升初机构综合评测

在宁波,从镇海的百年名校情结到海曙、鄞州的重点初中抢位战,小升初早已不是一场单纯的学业测验,而是牵动整个家庭的信息战与规划战。不少家长发现,外来连锁品牌常常“水土不服”,对本地配额分配、校考偏好和新初一分班…

2026/8/9 1:01:13 阅读更多 →

最新新闻

跨境随身WiFi多设备限速原因解析:商旅专用物联卡稳定组网

跨境随身WiFi多设备限速原因解析:商旅专用物联卡稳定组网

海外商务出差、跨境团队旅居、境外临时办公场景中,大部分团队都会依靠4G随身WiFi共享热点,实现多设备同时联网办公。实际使用中普遍存在一个棘手问题:单设备上网流畅稳定,一旦开启多人热点共享,网速会快速受限、延迟升…

2026/8/9 1:58:37 阅读更多 →
豆包智能体苹果版导出表格难题,终于被“AI导出鸭”终结了

豆包智能体苹果版导出表格难题,终于被“AI导出鸭”终结了

豆包智能体苹果版导出表格难题,终于被“AI导出鸭”终结了 如果你用苹果手机、iPad或Mac上的豆包App,应该对这件事不陌生——和智能体聊了几十轮,产出了一份结构清晰、含表格和数据的优质回答,想导出为表格文件做进一步处理&#x…

2026/8/9 1:58:37 阅读更多 →
Navicat Premium for Mac 14天试用期重置终极指南:轻松恢复数据库开发工具

Navicat Premium for Mac 14天试用期重置终极指南:轻松恢复数据库开发工具

Navicat Premium for Mac 14天试用期重置终极指南:轻松恢复数据库开发工具 【免费下载链接】navicat_reset_mac navicat mac版无限重置试用期脚本 Navicat Mac Version Unlimited Trial Reset Script 项目地址: https://gitcode.com/gh_mirrors/na/navicat_reset_…

2026/8/9 1:58:37 阅读更多 →
你的 RAG 到底答得准不准? 给它做评估 + 混合检索与重排

你的 RAG 到底答得准不准? 给它做评估 + 混合检索与重排

你兴冲冲地把 chunk 大小从 300 调到 500,感觉「好像变好了」——但真的变好了吗,还是错觉?没有一把尺子,你永远在凭感觉打转。RAG 优化的第一性原理是:先能度量,才谈得上改进。 今天我们先造出这把尺子&am…

2026/8/9 1:58:37 阅读更多 →
一套漫画看懂什么是 RAG

一套漫画看懂什么是 RAG

很多人第一次接触 RAG 时,都会有同一种感觉: 这个词在 AI 圈里很常见,但真正解释清楚时,往往又容易变得很技术、很抽象。 所以这次我换一种方式——直接用一套知识漫画,把 RAG 讲明白。 如果先用一句最直白的话概括&am…

2026/8/9 1:58:37 阅读更多 →
告别模组混乱:AML启动器带你轻松管理XCOM 2与奇美拉小队模组

告别模组混乱:AML启动器带你轻松管理XCOM 2与奇美拉小队模组

告别模组混乱:AML启动器带你轻松管理XCOM 2与奇美拉小队模组 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mir…

2026/8/9 1:57:36 阅读更多 →

日新闻

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁 【免费下载链接】baidupankey 在线查询网盘提取码(维护中 rm repo) 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 你是否曾经在深夜寻找一份重要资料&#x…

2026/8/9 0:01:47 阅读更多 →
如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/9 0:01:47 阅读更多 →
收藏!小白程序员轻松入门大模型,从Harness工程开始实践

收藏!小白程序员轻松入门大模型,从Harness工程开始实践

文章强调学习大模型不应只关注模型本身,而应重视模型外的系统搭建,即Harness。提出AgentModelHarness的实用公式,详细介绍Harness的四个层次:持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.…

2026/8/9 0:03:48 阅读更多 →

周新闻

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁 【免费下载链接】baidupankey 在线查询网盘提取码(维护中 rm repo) 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 你是否曾经在深夜寻找一份重要资料&#x…

2026/8/9 0:01:47 阅读更多 →
如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/9 0:01:47 阅读更多 →
收藏!小白程序员轻松入门大模型,从Harness工程开始实践

收藏!小白程序员轻松入门大模型,从Harness工程开始实践

文章强调学习大模型不应只关注模型本身,而应重视模型外的系统搭建,即Harness。提出AgentModelHarness的实用公式,详细介绍Harness的四个层次:持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.…

2026/8/9 0:03:48 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/8 17:02:44 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/9 0:45:04 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/8 17:02:44 阅读更多 →