ScrapeGraphAI 的 models_tokens 模块全解析:跨 Provider 模型 Token 上限字典与分片机制
网页爬虫人工智能AI 应用【免费下载链接】Scrapegraph-aiPython scraper based on AI项目地址https://gitcode.com/GitHub_Trending/sc/Scrapegraph-ai点击查看免费下载导读ScrapeGraphAI 是面向 AI 的 Python 抓取框架其核心能力之一是根据不同大模型LLM的上下文能力来规划抓取流程。本文聚焦 models_tokens 模块系统讲解这张按 Provider 组织的「模型 → 最大 Token 数」映射表它记录了什么、在 Graph 配置中如何被自动解析、如何手动覆盖以及它如何转化为chunk_size驱动文档分片。读完本文你将掌握在 ScrapeGraphAI 中正确配置 LLM 与 Token 上限、避免因上下文溢出导致抓取失败的完整实战方案。一、模块定位一张驱动分片的模型能力清单models_tokens位于 scrapegraphai/helpers/models_tokens.py是一个按 Provider如 OpenAI、Azure OpenAI、Google AI、Ollama 等组织的嵌套字典记录每个模型可接受的最大 Token 数。其定位正如官方文档所述This module contains a comprehensive dictionary of AI models and their corresponding token limits.该字典的意义在于ScrapeGraphAI 需要知道当前 LLM 的上下文窗口上限才能把过长的抓取内容切成合适大小的块。models_tokens与 utils/split_text_into_chunks.py 中的split_text_into_chunks(text, chunk_size)配合使用chunk_size即由模型 Token 上限换算而来。模块在包内部通过 helpers/init.py 导出from .models_tokens import models_tokens并被 graphs/abstract_graph.py 直接 import是整个 Graph 初始化链路的基石。二、数据结构Provider → 模型 → Token 上限字典采用两级结构models_tokens { openai: { gpt-4o: 128000, gpt-4: 8192, ... }, ollama: { llama3.1: 128000, ... }, ... }当前仓库中注册的 Provider 键从源码结构看与abstract_graph.py中known_providers集合基本一一对应包括Provider 键覆盖模型类型说明openaiGPT 全系列、o 系列、gpt-oss条目最多含 gpt-4.11048576azure_openai与 openai 高度重合面向 Azure OpenAI 部署google_genai/google_vertexaiGemini 系列含 200 万 Token 的 gemini-2.0-proollama本地开源模型含 embedding 模型anthropic/bedrockClaude 系列bedrock 含 Amazon/Meta/Mistral 模型mistralaiMistral 系列含 codestral256000deepseek/ernie/minimaxDeepSeek、文心、MiniMax国内模型nvidia/groq/fireworksNVIDIA NIM、Groq、Fireworks高性能推理平台hugging_faceHF 开源模型含 embedding 与 GGUF 变体toghetherai/togetheraiTogether AI 模型注意仓库存在两个拼写键clod/xai/oneapiCLoD、Grok、Qwen对应自定义模型封装注意源码中同时存在toghetherai与togetherai两个键togetherai仅含一个条目这是当前仓库的实际状态使用时需留意拼写。三、官方文档给出的基础用法原文档 scrapegraphai.helpers.models_tokens.rst 给出的示例是理解本模块的起点完整继承如下from scrapegraphai.helpers.models_tokens import models_tokens # Get the token limit for GPT-4 gpt4_limit models_tokens[openai][gpt-4] print(fGPT-4 token limit: {gpt4_limit}) # Check the token limit for a specific model model_name gpt-4o-mini if model_name in models_tokens[openai]: print(f{model_name} token limit: {models_tokens[openai][model_name]}) else: print(f{model_name} not found in the models list)官方文档还强调该信息对于用户设计抓取管道pipeline时理解不同 AI 模型的能力与限制至关重要——这正是models_tokens贯穿全框架的根本原因。四、主流 Provider 的 Token 上限速查4.1 OpenAI含 GPT-4.1 百万级上下文模型Token 上限gpt-3.5-turbo / gpt-3.5-turbo-0125 / -110616385gpt-3.5 / gpt-3.5-turbo-instruct4096gpt-4 / gpt-4-06138192gpt-4-32k / gpt-4-32k-061332768gpt-4-turbo / gpt-4-turbo-preview / gpt-4-1106-preview / gpt-4-0125-preview / gpt-4-vision-preview / gpt-4o / gpt-4o-mini / gpt-4.5 / gpt-4.5-preview128000gpt-4.1 / gpt-4.1-mini / gpt-4.1-nano1048576o1 / o1-pro / o3 / o3-pro / o3-mini / o4-mini / gpt-5 / gpt-5.1 等200000gpt-oss-120b / gpt-oss-20b1280004.2 Google Gemini模型Token 上限gemini-pro / gemini-1.5-flash-latest / gemini-1.5-pro-latest128000gemini-2.0-flash-latest / gemini-2.0-flash-exp1000000gemini-2.0-pro-exp2000000models/embedding-0012048VertexAI 侧gemini-2.0-pro同样给出 2000000gemini-2.0-flash为 1048576。4.3 Ollama本地模型含 embedding模型Token 上限llama2 / llama2:7b / llama2:13b / llama2:70b4096llama3 / llama3:8b / llama3:70b8192llama3.1 / llama3.2 / llama3.3含各尺寸变体128000command-r / phi3:3.8b12800mixtral:8x22b-instruct / wizardlm2:8x22b65536qwen:0.5b qwen:110b32000mistral / mistral-small / mistral-large / gemma2 系列128000mxbai-embed-large512其余 embeddingdmeta、acge、snowflake-arctic 等81924.4 Anthropic / BedrockClaudeanthropic下绝大多数 Claude 模型claude3、claude3.5、claude-opus-4、claude-sonnet-4、claude-3-7-sonnet 等为 200000claude2为 9000claude_instant为 100000。bedrock以 AWS 型号 ID如anthropic.claude-3-5-sonnet-20240620-v1:0为键并额外收录 Llama、Mistral、Titan、Cohere 等模型的 Token 上限。4.5 其他 Provider 要点NVIDIAmicrosoft/phi-3-mini-128k-instruct为 122880meta/codellama-70b为 16384多数模型在 2K32K 之间。Groqllama-3.1-8b-instant/llama-3.3-70b-versatile为 128000mixtral-8x7b-32768为 32768。MistralAIcodestral-latest与open-codestral-mamba为 256000mistral-embed为 8000。Hugging Face多为 8K32K 的开源模型gradientai/Llama-3-8B-Instruct-Gradient-1048k达到 1040200。DeepSeek / ERNIE / MiniMaxdeepseek系列为 128000ernie全系为 4096MiniMax M1 达 1000000、M2.x 为 204000。五、在 Graph 配置中的自动解析机制源码级models_tokens的真正价值体现在 abstract_graph.py 的_create_llm方法。当你在 graph 配置中只给出model: gpt-4o而省略 provider 时框架会自动推断 Provider若模型名不含/则遍历models_tokens.items()找出包含该模型名的 Provider 作为model_provider若找不到任何 Provider抛出ValueError。校验 Providermodel_provider必须存在于known_providers集合否则报错并提示改用model_instance。读取 Token 上限self.model_token models_tokens[model_provider][model]若该模型未收录则logger.warning提示「请在 graph 配置的 llm 段指定model_tokens参数」并回退到默认值8192。if llm_params.get(model_tokens, None) is None: try: self.model_token models_tokens[llm_params[model_provider]][llm_params[model]] except KeyError: logger.warning(...) self.model_token 8192 else: self.model_token llm_params[model_tokens]这段代码揭示了三层优先级显式model_tokensmodels_tokens字典 默认 8192。手动覆盖示例对于字典未收录的新模型或需要主动收紧上下文时可在配置中显式指定config { llm: { model: your-new-model, model_provider: openai, # 可选帮助框架定位 model_tokens: 32000, # 手动指定 Token 上限 temperature: 0.1, }, }六、从 model_token 到 chunk_size 的分片链路self.model_token会被注入各 Graph 节点的chunk_size从而控制文档切分粒度。例如smart_scraper_graph.pynode_config{llm_model: self.llm_model, chunk_size: self.model_token}document_scraper_graph.pychunk_size: self.model_tokenscript_creator_graph.py、code_generator_graph.py、speech_graph.py 等均有同样注入。在 parse_node.py 中chunk_size被进一步收缩如chunk_size - 250、min(chunk_size - 500, int(chunk_size * 0.8))为输出 token 预留空间再调用分片工具而 split_text_into_chunks.py 默认走semchunk语义分片并将chunk_size再乘以 0.9 作为安全余量chunk_size min(chunk_size, int(chunk_size * 0.9))。换言之models_tokens里记录的数值最终经过多级打折后才成为实际喂给模型的块大小因此 8192 的默认回退值对于 128K 上下文的现代模型而言偏保守但安全。七、测试保障字典结构与取值校验仓库通过 tests/test_models_tokens.py 对字典施加了严格约束可视为使用该模块的「契约」每个 Provider 必须是非空字典模型名为非空字符串且无首尾空白所有 Token 值必须是正整数且落在 11100000 的合理区间test_token_limits_rangeProvider 总数不少于 15test_providers_count总模型数大于 20针对关键模型断言具体数值gpt-4 8192、gpt-3.5-turbo-0125 16385、anthropic.claude_instant 100000、meta/codellama-70b 16384 等不存在的 Provider / 模型返回None。此外tests/graphs/abstract_graph_test.py 通过 monkeypatch 将models_tokens替换为缺条目的字典验证「模型未收录时回退默认 token」的容错路径tests/test_minimax_models.py 则专门校验 MiniMax 系列模型的收录与数值。这说明字典的正确性直接影响 Graph 初始化行为是框架可信赖度的一部分。八、实践建议与注意事项新模型务必显式配置model_tokens未被字典收录的模型会静默回退到 8192导致长文档被切成过小块、增加调用次数或截断上下文因此在llm配置段显式给出model_tokens是最稳妥的做法。留意 Provider 拼写仓库中toghetherai与togetherai并存配置model_provider时需与known_providers见 abstract_graph.py保持一致。数值代表「最大输入 Token」而非安全容量分片链路中 parse 节点与 semchunk 均会预留余量0.80.9 因子无需用户再手动打折。本地模型注意 embedding 条目Ollama / Bedrock / Mistral 等 Provider 混入了 embedding 模型如mxbai-embed-large仅 512它们不应用于文本生成节点选择模型时请区分用途。多模型场景框架支持model含/的形式如model: ollama/llama3.1此时框架会按斜杠拆分 provider 与模型名与models_tokens的自动推断机制互为补充。九、小结models_tokens是 ScrapeGraphAI 中「小而关键」的基础设施一张跨 20 Provider 的模型 Token 上限字典向上支撑 Graph 初始化时的模型解析与 Token 回退向下经model_token → chunk_size驱动语义分片并有完整测试保证数据契约。理解它就等于掌握了为 ScrapeGraphAI 配置任意 LLM 的上下文边界管理方法。赞分享网页爬虫人工智能AI 应用【免费下载链接】Scrapegraph-aiPython scraper based on AI项目地址https://gitcode.com/GitHub_Trending/sc/Scrapegraph-ai点击查看免费下载相关推荐解决ScrapeGraphAI中Ollama模型上下文长度限制的实战指南解决ScrapeGraphAI中Ollama模型上下文长度限制的实战指南 你是否在使用ScrapeGraphAI处理长文档时遇到过上下文溢出错误是否发现L网页爬虫人工智能AI 应用NOFX Token 估算机制全解析候选币种上限、模型上下文窗口与策略配置调优NOFX Token 估算机制全解析候选币种上限、模型上下文窗口与策略配置调优 面向 AI 交易终端NOFX的策略配置与模型选择场景本文以 docs/tAI Agent金融科技后端前端OpenRGB终极免费开源RGB统一控制方案告别多软件混乱时代OpenRGB终极免费开源RGB统一控制方案告别多软件混乱时代 你是否厌倦了电脑上安装五六个不同的RGB控制软件雷蛇需要Synapse海盗船要iCUE桌面应用硬件开发智能硬件上一篇SymPy 初等函数模块Elementary Functions全解析复数分解、三角/双曲、指数对数与分段函数的符号计算实战下一篇如何用深蓝词库转换彻底解决输入法切换难题完整指南创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

Docker Compose 一键部署 Redis + Redis-Commander 可视化管理工具

Docker Compose 一键部署 Redis + Redis-Commander 可视化管理工具

Docker Compose 部署 Redis6.2 Redis‑Commander 可视化管理【redis有密码】-CSDN博客 一、方案简介 本文提供一套完整 docker-compose-redis.yml 编排文件,可一次性启动 Redis 6.2 服务与 Redis Commander 可视化管理面板,具备容器自重启、健康检查、…

2026/9/30 11:04:55 阅读更多 →
FTTR全光家庭网络:从物理层重构Wi-Fi体验

FTTR全光家庭网络:从物理层重构Wi-Fi体验

简介:本资源为华为FTTR全光家庭网络创新解决方案的完整技术白皮书PDF,面向通信工程师、宽带网络规划人员、运营商装维团队及智能家居方案集成商,聚焦解决大户型Wi-Fi覆盖弱、千兆宽带实际速率不足(实测常低于签约带宽20%&#xff…

2026/9/30 11:03:55 阅读更多 →
网络安全技术基础入门:从核心概念到职业发展路线

网络安全技术基础入门:从核心概念到职业发展路线

网络安全技术基础——第1章:网络安全概述 说句实在话,我见过太多人一上来就撸工具、扫端口、翻漏洞报告,结果学了一个月连“这个漏洞到底危害在哪”都讲不清楚。网络安全这个方向,看着门槛低,实际上非常吃基础。你手里有工具&…

2026/9/30 11:03:55 阅读更多 →

最新新闻

Midjourney操作教程:Discord环境搭建、核心命令与参数调优全指南

Midjourney操作教程:Discord环境搭建、核心命令与参数调优全指南

简介:这份图文教程面向希望系统掌握Midjourney的AI绘画初学者与设计从业者,从零基础入门到进阶技巧均有覆盖,帮助读者解决不会注册、不懂命令、提示词写不好等常见问题。资源为1个PDF文档,压缩包约9.49MB,内容按前言、…

2026/9/30 11:52:18 阅读更多 →
SpringBoot+Vue打造月子护理中心管理系统:从业务拆解到部署全攻略

SpringBoot+Vue打造月子护理中心管理系统:从业务拆解到部署全攻略

搞过几个类似的“管理信息系统”项目之后,我越来越觉得这类业务系统真正的难点从来不是框架本身,而是业务流程的梳理。就拿当下这个“月子护理中心管理系统”来说,如果只是把增删改查堆出来,那无非是一个换了皮的学生作业&#xf…

2026/9/30 11:52:18 阅读更多 →
指数族与变分推断:从理论到Python实现

指数族与变分推断:从理论到Python实现

简介:这份PDF文档是概率图模型领域的经典综述,由Wainwright与Michael Jordan合著,面向机器学习、统计学方向的研究生与科研人员,帮助读者系统理解图模型、指数族与变分推断三者的内在联系。文档共1个PDF文件,压缩包约2…

2026/9/30 11:52:18 阅读更多 →
IT英文缩写汇总:从API到IO的技术分层与避坑指南

IT英文缩写汇总:从API到IO的技术分层与避坑指南

简介:这份《IT行业标准英文缩写汇总(2024年版)》面向IT工程师、技术人员及计算机相关专业学生,系统整理了硬件、软件、网络、数据库等领域常用英语缩写,每条均给出英文全称、缩写形式与汉语释义,可作为日常技术查阅、团队沟通与文…

2026/9/30 11:52:18 阅读更多 →
Mac零基础入门Cursor:从安装到AI编程实战指南

Mac零基础入门Cursor:从安装到AI编程实战指南

说实话,我刚开始接触 Cursor 的时候,也跟很多零基础的朋友一样,满脑子问号:这玩意儿到底怎么装?界面全是英文怎么办?免费版够不够用?是不是一定要买 Pro?那时候我连 “Agent” 和 “…

2026/9/30 11:52:18 阅读更多 →
深入理解Linux IO:文件描述符、缓冲与重定向机制

深入理解Linux IO:文件描述符、缓冲与重定向机制

1. 从“一切皆文件”说起:Linux IO的整体设计思路1.1 为什么理解文件操作是Linux编程的分水岭Linux世界里流传着一句经典的话:一切皆文件。这句话不是说Linux系统里所有东西都是磁盘上的文件,而是说Linux对所有输入输出设备、管道、网络连接、…

2026/9/30 11:51:16 阅读更多 →

日新闻

Base64 图片头部特征识别:从文件头到格式判断的完整指南

Base64 图片头部特征识别:从文件头到格式判断的完整指南

1. 项目概述:为什么说看懂 base64 图片头部是基本功这几年跟 base64 打交道的机会越来越多,后端接口返回图片、前端渲染验证码、小程序里存小图、还有一些老系统导出报表,动不动就给你一段长到怀疑人生的 base64 字符串。很多人拿到字符串就直…

2026/9/30 0:00:35 阅读更多 →
Java公交站牌广告管理系统:JSP+Servlet+MySQL实战落地指南

Java公交站牌广告管理系统:JSP+Servlet+MySQL实战落地指南

简介:本资源是一份面向Java初学者与课程设计学生的公交站牌广告灯箱管理系统毕业设计文档,聚焦城市公共广告资源信息化管理痛点,提供从需求分析到技术实现的完整方案。文档采用标准学术论文结构,含摘要、英文摘要、目录及五章正文…

2026/9/30 0:00:35 阅读更多 →
用 Redis Lua 构建大模型 API 多租户原子配额治理体系

用 Redis Lua 构建大模型 API 多租户原子配额治理体系

我去年年底接了一个内部 AI 平台的治理需求,背景很直接:公司把 DeepSeek、MiniMax 这类大模型 API 统一封装成内部网关,开放给几个业务团队用。结果第一个月账单出来,额度直接超了 4 倍。仔细查日志,发现原因并不复杂—…

2026/9/30 0:00:35 阅读更多 →

周新闻

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解 【免费下载链接】spirula-studio Cross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA. 项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio Sp…

2026/9/29 8:16:59 阅读更多 →
SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南 模板网站太丑不够用?别急着加滤镜,那是治标不治本。很多老板盯着后台流量掉得眼红,却还在纠结首页Banner的圆角是不是3像素。这就像穿着西装去挖土,姿势不对,努力白费。我整理这份 速查手册…

2026/9/29 16:41:41 阅读更多 →
FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏 【免费下载链接】FireRed-OpenStoryline FireRed-OpenStoryline is an AI video editing agent that transforms manual editing into intention-driven directing through natural language …

2026/9/29 8:24:48 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/29 19:29:29 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/29 5:58:00 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/29 3:55:56 阅读更多 →