ReconVLA:作为有效机器人感知器的重建视觉-语言-动作模型
作者Wenxuan Song1^11Ziyang Zhou1^11Han Zhao2,3^{2,3}2,3Jiayi Chen1^11Pengxiang Ding2,3^{2,3}2,3Haodong Yan1^11Yuxin Huang1^11Feilong Tang4^44Donglin Wang2^22Haoang Li1^11机构1^11香港科技大学广州2^22西湖大学3^33浙江大学4^44蒙纳士大学https://arxiv.org/pdf/2508.10333摘要近年来视觉-语言-动作Vision-Language-Action, VLA模型的进展使得机器人智能体能够将多模态理解与动作执行相结合。然而我们的实证分析表明当前的VLA模型难以将视觉注意力分配到目标区域其视觉注意力往往处于分散状态。为了引导视觉注意力准确定位到正确的目标上我们提出了ReconVLA这是一种采用隐式定位implicit grounding范式的重建VLA模型。以模型的视觉输出为条件一个扩散Transformerdiffusion transformer旨在重建图像的注视区域gaze region该区域对应于被操作的目标物体。这一过程促使VLA模型学习细粒度的表示并准确地分配视觉注意力从而有效地利用特定任务的视觉信息并执行精确的操作。此外我们从开源机器人数据集中策划了一个包含超过10万条轨迹和200万个数据样本的大规模预训练数据集进一步提升了模型在视觉重建方面的泛化能力。在仿真和真实世界中的大量实验证明了我们隐式定位方法的优越性展示了其精确操作和泛化的能力。项目主页https://zionchow.github.io/ReconVLA/。1. 引言近年来视觉-语言模型VLMs的进展展示了它们有效桥接感知和语言模态的潜力。基于这些进展视觉-语言-动作VLA模型通过整合多模态理解将这种能力扩展到了动作执行领域。得益于数十亿的参数量以及在大规模机器人数据集上的预训练这些模型在实现可泛化技能方面展现出了巨大的希望。准确的视觉定位visual grounding是实现VLA精确抓取的基础尤其是在杂乱的环境和长视野long-horizon任务中。为了分析预测动作期间的视觉定位行为我们可视化了视觉输入上的注意力图。结果表明传统的VLA模型通常表现出分散的视觉注意力如图4第1行所示无法精确聚焦于目标物体这可能导致操作错误的物体。这一发现提出了一个关键问题VLA模型如何改进视觉注意力分配并进一步提升视觉定位能力以往用于VLA的视觉定位方法通常以显式方式输入已定位的图像或以思维链Chain-of-Thought, CoT的方式输出边界框。这些方法增强了对目标区域的感知并提高了空间意识但它们并没有从根本上改进注意力分配。受重建视觉指令微调的启发我们引入了一个辅助视觉重建模块该模块实现为一个轻量级的扩散Transformer。该模块以VLA模型的视觉输出为条件旨在从噪声中重建目标操作区域。这一过程促使VLA模型学习包含区域特定信息的细粒度表示从而将视觉注意力集中在正确的区域。如图1所示这种机制类似于人眼的注视行为即眼睛感知到一个清晰聚焦的小区域而周围区域保持模糊。因此目标操作区域被称为注视区域gaze region。然而与它们的VLM主干网络类似传统的VLA模型在视觉-语言理解任务上进行微调并以自回归的方式生成动作缺乏视觉生成能力。为了解决这一限制我们策划了一个包含超过10万条轨迹和200万个数据样本的预训练数据集。我们选择了几个开源机器人数据集并设计了一种通过Grounding DINO进行自动数据处理的方法以生成完整图像和目标操作区域图像的配对。在这个大规模数据集上的预训练显著增强了模型在视觉生成方面的泛化能力。通过利用上述技术我们开发了重建视觉-语言-动作模型ReconVLA。它以当前图像、语言指令和机器人本体感知作为输入。在训练期间输入图像的注视区域通过冻结的视觉分词器处理为潜在token这保留了详细的视觉信息并实现了高保真重建。为了更好地学习潜在信息我们训练了一个扩散Transformer学习在重建token的引导下恢复潜在token。扩散去噪有效地对视觉观察的条件分布进行了建模。长视野任务中的实验表明我们的隐式定位方法比其他视觉定位范式更有效。此外视觉注意力的可视化证明我们的ReconVLA表现出具有方向性的视觉注意力并实现了精确操作。消融研究证明了通过大规模预训练实现的泛化能力。与其他流行方法的全面比较表明ReconVLA产生了卓越的性能。最后真实世界的实验评估了对未见物体的泛化能力证明了ReconVLA具有促进VLA在真实世界部署的潜力。总结来说我们的主要贡献如下我们提出了ReconVLA这是一种具有隐式定位范式的重建VLA模型。注视区域的重建促使模型进行精确的视觉注意力分配和细粒度表示学习从而增强视觉定位能力并执行精确操作。我们构建了一个大规模的机器人预训练数据集包含超过10万条轨迹和200万个数据样本。在该数据集上的预训练增强了模型视觉重建能力的泛化。在仿真和真实世界中的大量实验显示了我们隐式定位方法的优越性以及对未见目标精确操作和泛化的能力。2. 相关工作以动作为中心的视觉-语言-动作模型。建立在预训练VLM的基础进展之上VLA学习在动作的监督下生成可执行的动作。其中RoboFlamingo使用显式策略头对序列历史信息进行建模Open-VLA是第一个具有大规模机器人预训练的开源VLA模型VLAS通过音频扩展了模态UniVLA从网络规模的视频中学习以任务为中心的潜在动作。这些模型仅对动作输出进行监督而我们的ReconVLA将视觉输出作为辅助任务进行监督从而增强了视觉感知。用于操作的生成方法。之前的研究探索了用于机器人控制的图像或视频生成模型。Unipi首先生成未来图像并从中提取动作SuSIE使用图像编辑扩散模型生成子目标并使用与语言无关的策略执行它们CLOVER使用误差测量生成视觉计划来指导闭环策略GR-1首次将生成方法与VLA结合利用大规模视频预训练来预测未来图像和机器人动作3D-VLA进一步整合深度信息作为视觉-语言-动作推理和规划的指导GEVRM以闭环方式为目标条件策略生成未来图像。这些方法预测未来帧以从动力学中学习从而增强模型的规划能力。相比之下我们的方法重建当前图像的目标区域以实现精确的感知和操作。用于操作的视觉定位方法。显式定位方法通常将已定位的图像作为额外输入以充当辅助观察图2a。例如RoboGround采用LISA作为高级分割器根据指令提取目标物体和背景并将其作为观察的一部分输入VLA模型。类似地VIP使用YOLOv11分割目标物体然后将其放大并提供给基于Transformer的策略。然而这些模型依赖外部专家模型并没有从根本上增强策略本身的视觉定位能力。ECoT和GraspVLA图2b采用思维链方法按顺序输出边界框和动作这同时训练了定位能力并通过因果注意力为动作输出提供了更丰富的信息。与这些先前的方法相比我们的ReconVLA直接从视觉输出中重建目标操作区域图2c从而在鼓励模型学习目标区域细粒度表示的同时隐式地执行定位。这一过程模仿了人眼自发聚焦于视野内显著区域的能力。3. 方法3.1 预备知识为了建立我们方法的基础我们首先形式化机器人操作上下文中VLA模型的典型公式和架构。给定一对图像和文本指令(I,S)(I, S)(I,S)VLA模型A\mathcal{A}A预测动作AA(I,S)A \mathcal{A}(I, S)AA(I,S)。架构一个常规的VLA主要由大语言模型LLMLLMLLM、视觉编码器E\mathcal{E}E、分词器TTT和动作反分词器QQQ组成。元组(I,S)(I, S)(I,S)分别被E\mathcal{E}E和TTT处理为图像tokenhIh_IhI​和文本tokenhSh_ShS​。这些token随后被输入到LLMLLMLLM中以生成动作tokenaaa。最后动作反分词器QQQ将aaa映射为用于机器人控制的可执行动作AAA。整个过程可以表示为AQ(a)Q(LLM(hI,hS))Q(LLM(E(I),T(S)))(1)A Q(a) Q(LLM(h_I, h_S)) Q(LLM(\mathcal{E}(I), T(S))) \quad (1)AQ(a)Q(LLM(hI​,hS​))Q(LLM(E(I),T(S)))(1)具体而言动作token以自回归的方式生成p(a)∏i1NpLLM(ai∣a1∼i−1,hI,hS)(2)p(a) \prod_{i1}^N p_{LLM}(a_i | a_{1 \sim i-1}, h_I, h_S) \quad (2)p(a)i1∏N​pLLM​(ai​∣a1∼i−1​,hI​,hS​)(2)其中iii表示第iii个动作tokenNNN表示动作token的总数。3.2 重建视觉-语言-动作模型观察到分散的注意力我们的目标是引导VLA的视觉注意力聚焦到正确的目标上。我们的理念是构建一个辅助视觉监督通过设置重建视觉信号来实现。该监督信号作为条件引导扩散去噪过程以重建目标操作区域。正式地我们在此框架下提出重建视觉-语言-动作模型ReconVLA。重建目标当人类操作物体时会接收到场景的全局视图。然而视觉感知主要集中在其中的一小部分即打算操作的区域。这种行为被称为注视gaze。类似地我们ReconVLA的重建目标是目标操作区域我们称之为注视区域。注视区域不仅有助于模型在多个可操作区域中聚焦正确目标还增强了对这些区域的详细感知。此外该机制通过聚焦并切换到不同的子目标隐式地促进了长视野任务中的子任务规划。损失函数ReconVLA的整体训练目标包括(i) 由演示数据监督的自回归动作预测以及 (ii) 由注视区域的视觉特征监督的重建项即LReconVLALVLALVisual\mathcal{L}_{ReconVLA} \mathcal{L}_{VLA} \mathcal{L}_{Visual}LReconVLA​LVLA​LVisual​其中LVLA\mathcal{L}_{VLA}LVLA​是交叉熵损失LVisual\mathcal{L}_{Visual}LVisual​是重建tokenhRh_RhR​和重建目标I′II′之间的度量。潜在视觉重建为了从具有空间信息冗余的RGB输入中构建区域特定的视觉监督信号我们设计了一个去噪过程来重建具有注视区域低级特征的token。这一过程鼓励模型充分捕捉内在特征而不是克隆显式的RGB值。图3说明了我们的ReconVLA利用视觉分词器FFF提取目标场景tokenz0F(I′)z_0 F(I)z0​F(I′)。具体而言我们采用连续变分自编码器VAE作为视觉分词器FFF因为它具有视觉保真度并能捕捉细粒度的图像特征。去噪器DDD尝试预测噪声并在重建tokenhRLLM(hI)h_R LLM(h_I)hR​LLM(hI​)的条件下从噪声tokenztz_tzt​中恢复z0z_0z0​。重建目标函数遵循扩散过程形式化如下LV(hR,I′)Et,ϵ[∣∣P(zt;hR,t)−ϵ∣∣](3)\mathcal{L}_{V}(h_R, I) \mathbb{E}_{t, \epsilon}[||\mathcal{P}(z_t; h_R, t) - \epsilon||] \quad (3)LV​(hR​,I′)Et,ϵ​[∣∣P(zt​;hR​,t)−ϵ∣∣](3)其中ttt表示扩散时间步。去噪器DDD由带有自注意力模块的Transformer编码器块堆叠而成以捕捉噪声token和重建token之间的相关性。为了确保VLA模型处理与指令目标相对应的视觉token必须保证图像token关注指令token。因此我们在图像token之前 prepend 了一组指令token使图像token能够通过因果注意力融合这些前缀文本的信息。实验结果表明这种交错格式在不降低模型固有语言建模能力的情况下实现了我们的目标。实现细节在本文中我们基于预训练的视觉-语言模型LLaVA-7b构建ReconVLA该模型使用Qwen2-7b作为LLM主干并使用siglip-so400m-patch14-384作为视觉编码器。3.3 视觉预训练VLA模型的重建能力固有受限因为其VLM主干主要在视觉-语言理解任务上进行训练。为了增强其定位和重建特定区域的能力我们在大规模机器人数据集上设计了针对重建任务的预训练过程。数据集为了建立基础的重建能力我们基于大规模开源机器人数据集BridgeData V2以及高质量仿真数据集LIBERO和CALVIN构建了预训练数据集。给定图像-文本对我们微调了Grounding DINO最先进的开放词汇目标检测器以分割出机器人被指示交互的注视区域。裁剪后的图像和原始图像以配对方式组织。通过这种方式我们获得了一个包含超过10万条轨迹和200万个样本的带标注视觉预训练数据集。预训练在预训练过程中我们同时对重建损失和动作损失执行梯度反向传播以保持优化目标的一致性。这一过程赋予了我们的VLM通用的视觉重建能力并促进了模型在多样化环境和任务中的部署。预训练后我们在特定任务上微调模型以精确地将视觉-语言理解和视觉重建能力与相应动作空间上的操作能力对齐。4. 实验在本节中我们构建实验以回答以下问题我们的隐式定位方法是否优于其他视觉定位范式见4.2节注视机制是否有助于视觉定位并进一步提升精确操作见4.3节我们提出的预训练阶段是否改善了视觉生成的泛化能力ReconVLA中提出的其他关键设计如何影响整体性能见4.4节与其他竞争性方法相比ReconVLA能否有效管理长视野任务见4.5节ReconVLA能否在真实世界任务中实现对未见目标的泛化操作见4.6节4.1 仿真环境CALVIN基准测试建立在PyBullet仿真器之上涉及一个Franka Panda机械臂操作场景。CALVIN包含34个任务和4个不同的环境A、B、C和D。CALVIN长视野挑战是一个包含五个子任务的序列任务。我们报告每个子任务的成功率以及所有五个任务的平均完成长度。该方法在500次rollouts中进行评估以确保公平比较。CALVIN的指标是每个子任务的成功率和所有连续5个子任务的平均长度。4.2 范式比较我们在相同的基线上实现了图2中的不同视觉定位范式以进行公平比较。显式定位 (EG)我们选择微调的YOLOv11作为检测器在每个时间步识别目标物体。然后我们从图像中裁剪出识别出的物体区域并调整其大小。随后调整大小后的图像和原始图像被联合输入到VLA模型中以指导物体操作。思维链定位 (CG)对于数据准备我们使用检测器预处理图像以获取边界框的坐标。然后我们重新格式化训练数据集并将输出修改为CoT格式Bbox [x1 x2 y1 y2] 动作序列。输入保持为原始图像。通过这种方式VLA模型学习定位目标物体并输出带有定位信息的动作。结果如表1所示EG获得了比基线相对更高的成功率。这表明将显式定位作为输入有助于更好地理解空间关系。然而完整图像和裁剪图像的简单拼接引入了视觉信息冗余限制了模型性能。CG的性能甚至更差。这表明坐标形式的边界框不足以有效指导模型精确操作目标位置。此外直接同时输出精确坐标和动作值对VLA模型提出了训练挑战。我们的隐式定位方法获得了最高的成功率这证明了我们方法优于其他范式。从训练机制的角度来看优势源于我们的隐式定位学习框架它使模型能够精确关注目标物体的视觉信息从而实现精确操作。从架构的角度来看我们的模型直接监督视觉输出消除了对额外输入或输出的需求。这种设计产生了一个简单而有效的训练和推理流程。4.3 深入分析为了更好地探索注视机制的影响我们对视觉注意力及其对细粒度操作任务的影响进行了定性实验。注意力可视化图4表明LVisual\mathcal{L}_{Visual}LVisual​的实现使得注意力能够与注视区域对应于目标物体紧密对齐。对于指令“把西瓜放进黄碗里”基线的注意力高度分散第三视角图像的注意力主要集中在无关位置导致任务失败。相比之下ReconVLA成功地将注意力集中在正确的目标即西瓜上。这表明我们的方法带来了精确的视觉定位从而促进了任务的成功。精确操作在所有任务中“叠方块”任务是最具挑战性的它要求机器人举起一个方块并将其精确地叠放在另一个方块上。虽然我们的基线在此任务上仅达到59.3%的成功率但我们的注视机制实现了高达79.5%的成功率提升了20.2%。这一显著改善突显了我们的注视机制通过精确视觉定位对动作准确性的增强作用。4.4 消融研究我们在表2中对使用重建部分、注视区域和大规模机器人数据集预训练的提议技术进行了消融研究。我们观察到预训练导致成功率显著提高。这是因为在未见过的测试环境中定位目标物体并执行重建本质上具有挑战性并对模型的生成能力提出了泛化挑战。在大规模数据集上的预训练大幅增强了模型在视觉重建过程中的泛化能力。此外重建要操作的注视区域被证明比重建整个图像更有效。这引导模型的视觉注意力聚焦于目标物体从而避免操作错误的目标。值得注意的是被训练重建整个图像的模型仍然优于基线这可归因于整体视觉注意力的增强。然而在未见过的场景中重建具有像素冗余的整个图像是极具挑战性的这进一步限制了性能的提升。4.5 与最先进方法的比较比较方法我们将我们的模型与预测未来图像的生成方法UniPi, SuSIE, CLOVER, 3D-VLA, GR-1, Vidman, GEVRM以及大型VLA模型RoboFlamingo, VLAS, OpenVLA, UniVLA进行了比较如第2节所述。结果在基础的ABCD→DABCD \rightarrow DABCD→D任务中我们的ReconVLA实现了具有竞争力的性能成功完成了5个连续任务中平均4.23个第一个任务的成功率为98.0%。这表明我们的注视机制提供了灵活的规划能力以在长视野任务中实现更好的操作调度。ABC→DABC \rightarrow DABC→D任务挑战了对未见背景的泛化能力。我们的方法超越了所有生成方法包括在最后一个子任务上比流行的GR-1高出20%以上的成功率。这表明除了预测未来图像的生成模型外增强对当前观察的感知对于机器人操作同样具有价值。在参数量相当的情况下我们的方法在最后一个子任务上比OpenVLA高出20.6%比UniVLA高出7.6%这表明了我们隐式定位学习策略的有效性。4.6 真实世界多任务实验设置我们使用带有1自由度平行夹爪的6自由度AgileX PiPer机械臂进行了真实世界实验。此外我们使用RealSense D515深度相机作为基座眼Eye-on-Base并使用ORBBEC Dabai深度相机作为手部眼Eye-on-Hand以获取视觉输入。任务我们选择了四个代表性任务把水果放进碗里、叠碗、翻转杯子、收拾桌子。为了增强模型的泛化能力每个任务都包含目标物体和背景颜色的变化。我们平均每个任务收集150条轨迹。对于评估每个模型在每个任务上进行20次试验并使用成功率作为性能指标。对于未见任务我们将目标物体替换为未见过的物体。结果在四个真实世界任务中ReconVLA始终优于流行的OpenVLA和强大的PD-VLA在每种情况下都取得了最高的成功率。特别是ReconVLA在“把水果放进碗里”和“叠碗”任务中取得了接近或超过90%的成功率。OpenVLA在执行细粒度操作任务如翻转杯子和收拾桌子时表现出有限的效果而我们的ReconVLA通过精确的视觉定位实现了显著的性能提升。在未见任务中目标物体不在训练数据中OpenVLA和PD-VLA方法的成功率均接近0%。得益于大规模混合数据预训练我们的ReconVLA仍能成功定位目标物体并完成预期动作展示了我们方法在视觉泛化能力方面的优势。5. 结论在本文中我们分析并揭示了传统VLA中分散的视觉注意力问题这限制了精确操作。随后我们提出了一种重建视觉-语言-动作模型ReconVLA这是一种在隐式定位范式下训练的新型框架。我们的ReconVLA成功实现了准确的视觉注意力分配并进一步增强了操作技能。我们进一步为ReconVLA构建了一个大规模预训练数据集以使其在多样化场景和未见物体上实现泛化。在仿真和真实世界中的大量实验表明了我们隐式定位方法的优越性。

相关新闻

4bit/8bit 生死局:量化后的 Ornith 还剩多少真本事

4bit/8bit 生死局:量化后的 Ornith 还剩多少真本事

4bit/8bit 生死局:量化后的 Ornith 还剩多少真本事 【免费下载链接】Ornith-1.5-35B-A3B-GGUF 项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B-GGUF 本地跑大模型的玩家都懂这道算术题:模型权重体积决定显存下限&am…

2026/10/11 16:27:38 阅读更多 →
SQL Server 2008 R2 资源控制器实战:CPU 与内存分配方案

SQL Server 2008 R2 资源控制器实战:CPU 与内存分配方案

简介:这份文档面向SQL Server数据库管理员与解决方案供应商,聚焦SQL Server 2008 R2中CPU与内存资源的分配优化问题。相比SQL Server 2005依赖独立实例与处理器亲和性的做法,2008 R2引入的资源控制器可通过SQL Server Management Studio定义资…

2026/10/11 16:26:38 阅读更多 →
软件测试学习路线与面试实战:从用例设计到自动化测试的进阶指南

软件测试学习路线与面试实战:从用例设计到自动化测试的进阶指南

1. 先把底色打牢:我理解中的软件测试基本功很多人问我"卷王"这个称呼是怎么来的,说实话我挺不好意思的。我的日常其实特别枯燥:别人下班刷剧的时候,我在整理测试用例;别人周末打游戏的时候,我在搭…

2026/10/11 16:26:38 阅读更多 →

最新新闻

改进版Q-learning实战:Double Q、n步回报与经验回放

改进版Q-learning实战:Double Q、n步回报与经验回放

简介:基于Q-learning的改进版强化学习算法项目,聚焦路径规划场景,面向MATLAB用户及强化学习入门者。项目针对经典Q-learning收敛慢的问题,融合学习率衰减、动态ε-greedy探索、经验回放、目标网络与双线性更新等改进策略&#xff…

2026/10/11 23:38:45 阅读更多 →
定时任务从Crontab到XXL-JOB:选型、实现与运维避坑指南

定时任务从Crontab到XXL-JOB:选型、实现与运维避坑指南

定时任务这个东西,我在不同项目里来来回回用了好多年。最早是拿 shell 脚本挂着 crontab 跑,后来做 PHP 后台管理系统时研究过 likeadmin 这类框架里定时任务的执行机制,再到现在维护 SpringCloud 集群,又得面对分布式定时任务怎么…

2026/10/11 23:38:45 阅读更多 →
VOC垃圾检测数据集14963张:Darknet训练YOLO全流程指南

VOC垃圾检测数据集14963张:Darknet训练YOLO全流程指南

简介:面向YOLOv3/v4/v5及Darknet框架训练需求,这份VOC格式垃圾分类数据集提供了完整的图片、标注与标签体系。数据集中包含14963张垃圾图片,每张均对应同名xml标注文件和yolo格式txt文件,合计44类全英文标签,并额外提供…

2026/10/11 23:38:45 阅读更多 →
社交网络链路预测实战:Python图算法与VGAE工程化指南

社交网络链路预测实战:Python图算法与VGAE工程化指南

简介:本资源是一套面向高校本科生与研究生的社交网络链路预测实践项目,适用于毕业设计、课程设计及科研入门场景,聚焦图神经网络与传统相似性指标在关系预测中的建模与对比分析。压缩包含345个文件,总大小33.94MB,其中…

2026/10/11 23:38:45 阅读更多 →
HarmonyOS 7 GridRow:折叠屏筛选面板断点抖动门禁【鸿蒙心迹】

HarmonyOS 7 GridRow:折叠屏筛选面板断点抖动门禁【鸿蒙心迹】

相册筛选页最难解释的状态异常,有时并不出现在网络请求上。用户只是把折叠屏展开、收回,再展开,原本已经勾好的“城市、夜景、建筑”仍然亮着,结果列表却突然刷新两遍。更糟糕的是,第一次请求还没回来,第二…

2026/10/11 23:38:45 阅读更多 →
Q-learning改进版全解析:目标网络、经验回放与Double Q实战

Q-learning改进版全解析:目标网络、经验回放与Double Q实战

简介:这份资源是基于Q-learning改进的强化学习算法实现,开发工具为MATLAB,面向路径规划与人工智能学习者,适合机器人导航、网格寻路、游戏AI等场景下的最优策略求解问题。ZIP压缩包共包含21个文件,以19个.m脚本为核心&…

2026/10/11 23:37:44 阅读更多 →

日新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 10:45:37 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:53 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:54 阅读更多 →