LLaMA 学习笔记
目录llama_cppLLaMA模型结构模型微调手册显存占用推理示例指定位置加载模型 测试ok模型下载llama-stack 下载modelscope 下载LLaMA优化技术RMSNormSwiGLU 激活函数旋转位置编码RoPEllama_cpppip install llama-cpp-python# simple_inference.py from llama_cpp import Llama # 加载模型 llm Llama( model_path/data/feature/lbg/models/Khurram123_Qwen-GeoGebra-Coder-7B/math_viz_Q4_K_M.gguf, n_gpu_layers-1, n_ctx2048 ) # 单次推理 prompt Draw a circle with center at (0,0) and radius 5 # 生成 output llm( f|im_start|user\n{prompt}|im_end|\n|im_start|assistant\n, max_tokens256, stop[|im_end|] ) print(output[choices][0][text])LLaMA模型结构llama3 结构详解-CSDN博客模型微调手册大模型微调 LLaMA详细指南准备环境、数据、配置微调参数微调过程_llama 微调-CSDN博客显存占用FP16/BF16≥A6000 / RTX 6000 Ada / 3090 / 409048G or 24G 才能完整加载INT8≥24GB 显存如 RTX 3090, 4090INT4≥10–14GB 显存如 RTX 3080 / 4070 Ti / A5000推理示例import transformers import torch model_id meta-llama/Meta-Llama-3-8B pipeline transformers.pipeline( pipeline(Hey how are you doing today?)指定位置加载模型 测试ok显存占用10G左右推理时长 2.56秒。from transformers import AutoTokenizer, AutoModelForCausalLM, pipeline import torch # ① 本地模型文件夹 model_dir rE:\data\models\LLM-Research\Meta-Llama-3-8B-Instruct # 例如 ./models/llama3-8b # ② 加载 tokenizer AutoTokenizer.from_pretrained(model_dir, trust_remote_codeTrue) model AutoModelForCausalLM.from_pretrained(model_dir, torch_dtypetorch.float16, # 视显存情况选择 fp16/bf16 load_in_4bitTrue, trust_remote_codeTrue, device_mapauto # 自动把权重分在可用 GPU/CPU ) # ③ 构建 pipeline pipe pipeline(text-generation, modelmodel, tokenizertokenizer) print(pipe(Hey, how are you doing today?, max_new_tokens50)[0][generated_text]) print(----) print(pipe(Whats the capital of France?, max_new_tokens20)[0][generated_text])load_in_8bit 显存占用12G推理速度5-7秒。load_in_8bitTrue, trust_remote_codeTrue,模型下载llama-stack 下载pip install llama-stack语法不对llama download --source meta --model-id meta-llama/Meta-Llama-3-8B-Instructmodelscope 下载pip install modelscope -Umodelscope download --model LLM-Research/Meta-Llama-3-8B-InstructLLaMALLaMALarge Language Model Meta AI的拼写误差这是 Meta原 Facebook公司开发的开源大语言模型系列。以下是关于 **LLaMA 架构** 的详细解析**1. LLaMA 简介**- **全称**Large Language Model Meta AI- **开发方**Meta AIFacebook- **特点**开源、高效、覆盖多种参数量级7B~70B专为研究社区设计性能对标 GPT-3 等商用模型。**2. LLaMA 核心架构**LLaMA 基于 **Transformer 解码器**类似 GPT但通过优化提升了效率和性能关键改进包括**1基础结构**- **自回归模型**仅使用 Transformer 解码器堆叠通过掩码注意力实现单向预测。- **预训练目标**基于大规模文本的生成任务预测下一个词。优化技术RMSNorm替换 Layer Normalization减少计算量。SwiGLU 激活函数替代 ReLU提升模型表达能力。旋转位置编码RoPE动态处理序列位置信息支持更长的上下文窗口。- **分组查询注意力GQA**在 LLaMA-2 中引入平衡计算效率与效果。**3模型规模**| 版本 | 参数量 | 上下文长度 | 亮点 ||------------|--------|------------|--------------------------|| LLaMA-1 | 7B~65B | 2

相关新闻

SSRF漏洞实战:从原理到CTFHub技能树内网渗透与端口扫描

SSRF漏洞实战:从原理到CTFHub技能树内网渗透与端口扫描

1. 项目概述:从CTFHub技能树看SSRF实战精要最近在带新人过CTFHub的技能树,发现SSRF(Server-Side Request Forgery,服务端请求伪造)这个点卡住了不少人。很多人知道概念,但一碰到具体题目,比如“…

2026/8/16 22:44:41 阅读更多 →
swin_tiny_patch4_window7_224.ms_in1k 避坑实战:28.3M 参数的轻量图像分类模型从加载到跑通全记录

swin_tiny_patch4_window7_224.ms_in1k 避坑实战:28.3M 参数的轻量图像分类模型从加载到跑通全记录

swin_tiny_patch4_window7_224.ms_in1k 避坑实战:28.3M 参数的轻量图像分类模型从加载到跑通全记录 【免费下载链接】swin_tiny_patch4_window7_224.ms_in1k 项目地址: https://ai.gitcode.com/hf_mirrors/timm/swin_tiny_patch4_window7_224.ms_in1k 上个月…

2026/8/16 21:33:51 阅读更多 →
如何在Django Admin中集成Django-ColorField:5分钟快速上手

如何在Django Admin中集成Django-ColorField:5分钟快速上手

如何在Django Admin中集成Django-ColorField:5分钟快速上手 【免费下载链接】django-colorfield :art: color field for django models with a nice color-picker in the admin. 项目地址: https://gitcode.com/gh_mirrors/dj/django-colorfield Django-Colo…

2026/8/15 20:31:27 阅读更多 →

最新新闻

nslookup命令使用说明

nslookup命令使用说明

个人建站,域名备案完成后,往往还要做域名解析服务,技术人员怎么能知道自己配置的DNS正确与否呢?NSLOOKUP查询域名信息的一个非常有用的命令,可以指定查询的类型,可以查到DNS记录的生存时间还可以指定使用哪…

2026/8/17 0:00:08 阅读更多 →
【原创唯一】基于SpringBoot+Vue的在线书店商城系统 课程设计/大作业/期末作业(源码+MySQL数据库+实验报告+PPT+远程部署)

【原创唯一】基于SpringBoot+Vue的在线书店商城系统 课程设计/大作业/期末作业(源码+MySQL数据库+实验报告+PPT+远程部署)

摘要 电子商务与移动支付的普及,线上购书已成为高校师生及社会公众获取图书的重要方式。传统线下书店在图书检索、库存查询、订单跟踪等方面存在信息分散、效率较低等问题。本文设计并实现了一套基于 B/S 架构的网上书店系统,采用前后端分离模式&#xf…

2026/8/17 0:00:08 阅读更多 →
飞书局域网文件传输实战:3种方案实现高速点对点传输

飞书局域网文件传输实战:3种方案实现高速点对点传输

1. 项目概述:为什么要在局域网内用飞书传文件? 飞书作为一款主流的协同办公套件,其核心功能是围绕云端协作设计的。无论是文档、表格还是文件,通常的分享逻辑都是“上传到云端 -> 生成链接 -> 分享给同事”。这个流程在互联…

2026/8/17 0:00:08 阅读更多 →
LabVIEW异步调用实战:解决界面卡顿与并行处理难题

LabVIEW异步调用实战:解决界面卡顿与并行处理难题

1. 项目概述:为什么异步调用是LabVIEW进阶的必经之路如果你在LabVIEW里写过稍微复杂点的程序,尤其是涉及到界面响应、多任务并行或者硬件IO等待,大概率会遇到一个头疼的问题:程序“卡”住了。前面板点不动,进度条不更新…

2026/8/17 0:00:08 阅读更多 →
LabVIEW异步调用实战:从原理到生产者消费者模式,解决界面卡顿与并行处理难题

LabVIEW异步调用实战:从原理到生产者消费者模式,解决界面卡顿与并行处理难题

1. 项目概述:为什么异步调用是LabVIEW进阶的必修课? 如果你用LabVIEW做过稍微复杂点的项目,尤其是涉及界面响应、多任务并行或者硬件IO等待的场景,大概率遇到过这样的窘境:前面板点个按钮,整个程序就“卡死…

2026/8/17 0:00:08 阅读更多 →
错误分享:误将磁盘分区类型选成磁盘名称

错误分享:误将磁盘分区类型选成磁盘名称

1.先删除原有分区2.fdisk重新创建3.发现进程被占用4.使用kill关不掉进程,加 -9 强制关闭5.关闭后重新使用fdisk创建,tips:记得改完后要使用 w 保存

2026/8/16 23:59:08 阅读更多 →

日新闻

LabVIEW异步调用实战:从原理到生产者消费者模式,解决界面卡顿与并行处理难题

LabVIEW异步调用实战:从原理到生产者消费者模式,解决界面卡顿与并行处理难题

1. 项目概述:为什么异步调用是LabVIEW进阶的必修课? 如果你用LabVIEW做过稍微复杂点的项目,尤其是涉及界面响应、多任务并行或者硬件IO等待的场景,大概率遇到过这样的窘境:前面板点个按钮,整个程序就“卡死…

2026/8/17 0:00:08 阅读更多 →
LabVIEW异步调用实战:解决界面卡顿与并行处理难题

LabVIEW异步调用实战:解决界面卡顿与并行处理难题

1. 项目概述:为什么异步调用是LabVIEW进阶的必经之路如果你在LabVIEW里写过稍微复杂点的程序,尤其是涉及到界面响应、多任务并行或者硬件IO等待,大概率会遇到一个头疼的问题:程序“卡”住了。前面板点不动,进度条不更新…

2026/8/17 0:00:08 阅读更多 →
飞书局域网文件传输实战:3种方案实现高速点对点传输

飞书局域网文件传输实战:3种方案实现高速点对点传输

1. 项目概述:为什么要在局域网内用飞书传文件? 飞书作为一款主流的协同办公套件,其核心功能是围绕云端协作设计的。无论是文档、表格还是文件,通常的分享逻辑都是“上传到云端 -> 生成链接 -> 分享给同事”。这个流程在互联…

2026/8/17 0:00:08 阅读更多 →

周新闻

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

如果你是一名开发者,最近可能已经感受到了AI大模型正在从“玩具”变成“生产力工具”的强烈信号。从代码补全到智能Agent,从本地部署到云端API,我们正处在一个技术栈快速重构的节点。然而,面对层出不穷的模型、框架和工具&#xf…

2026/8/16 0:00:54 阅读更多 →
工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/16 0:00:55 阅读更多 →
【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

2026/8/16 0:03:55 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/16 6:00:23 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/16 6:00:24 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/16 6:00:27 阅读更多 →