文章核心总结与创新点主要内容该研究围绕大型语言模型(LLMs)在钓鱼网站检测(含目标品牌识别)中的应用展开,通过19,131个真实钓鱼网站和243个良性网站的数据集,对比7种LLMs(2种商业模型、5种开源模型)与2种深度学习(DL)基线模型的性能。重点探究输入模态(截图、logo、HTML、URL)、温度参数和提示工程对检测效果的影响,分析模型误分类原因,最终提出最优应用配置。核心创新点系统对比了商业/开源LLMs与传统DL模型的钓鱼检测性能,明确LLMs在真阳性检测、DL模型在真阴性检测上的优势。全面评估单一/多模态输入对品牌识别的影响,发现截图是最优输入模态,多模态组合反而可能引入噪声。揭示温度参数和提示工程的作用:低温(0.0/0.1)性能更优,单样本提示(one-shot)对多数模型无提升甚至有害。深入分析误分类原因,发现截图/HTML输入失败与文本内容相关,logo输入失败与颜色风格相关,为模型优化提供方向。公开数据集,为后续LLM-based钓鱼检测研究提供基础。英文原文翻译(Markdown格式)Abstract大型语言模型(LLMs)已成为一种极具潜力的钓鱼检测机制,可解决传统深度学习检测器的局限性,包括对未见过网站的泛化能力差以及缺乏可解释性等问题。然而,LLMs在钓鱼检测中的有效性仍有待探索。本