Actor-Critic Method
目录1. Value Network and Policy Network1.1 State-value function2. 更新策略2.1 用TD算法更新价值网络2.2 用policy gradient算法更新策略网络2.1 更新策略总结3. 动作价值函数和状态价值函数的意义3.1 Action-value function3.2 State-value function3.3 总结1. Value Network and Policy Network1.1 State-value function对于公式中的 policy函数和动作价值函数我们是不知道的因此使用两个神经网络来近似这两个函数。actor-critic算法就是价值学习和策略学习结合起来。ActorPolicy Network用来控制agent运动可看作运动员。使用一个神经网络来近似为网络的参数。CriticValue Network 用来给动作打分可看作裁判。使用一个神经网络来近似为网络的参数。学习的目的让Actor的分数越来越高并让Critic的打分越来越准确对状态价值函数的估计如下公式输入状态s即游戏中的超级马里奥截图输出所有可能的动作概率分布收集所有的动作概率分布所有动作概率分布的和为1使用softmax进行激活让最后输出的和为1输入状态s和动作a输出状态价值函数对动作a的打分即说明在状态s下做出动作a是好还是坏即就是裁判给体操运动员打分来评价动作的好坏训练两个网络也即更新这两个网络的参数。更新是为了提升的值更新是为了使得网络对于动作的打分更加准确。如何使状态价值函数对于动作的打分更加精准这依赖于环境的奖励reward环境给出的奖励越大说明网络的打分更加精确。2. 更新策略观测状态根据 policy 函数概率分布随机抽样动作得到Agent执行动作环境给出当前动作的打分以及下一个状态在价值网络中使用TD算法更新参数在策略网络中使用policy gradient算法更新参数2.1 用TD算法更新价值网络使用动作价值函数对动作和动作打分即计算和。计算TD目标此时计算的回报相较于计算得到的奖励更加精确因为此时的​中的当前奖励已知是对未来所有的奖励的估计。计算损失。使用梯度下降更新参数。2.2 用policy gradient算法更新策略网络利用蒙特卡洛近似计算期望也就是随机抽一个或很多样本用随机样本来近似计算期望。下面是用蒙特卡洛近似计算期望的流程。1.根据概率密度函数随机抽样得到一个动作。2.计算由于且是根据概率密度函数随机抽样得到的所以是的无偏估计。3.所以用当作的近似。有了前面策略学习的蒙特卡洛近似下面为更新参数的步骤记计算策略梯度策略梯度等于对函数求期望根据 policy 函数概率分布随机抽样动作得到是对期望的无偏估计因此直接使用对进行随机梯度上升2.1 更新策略总结观察到状态将带入策略函数中得到下一步所有动作的概率分布然后对该动作的概率分布进行随机抽样得到动作 a_tAgent执行动作环境给出当前动作的打分以及下一个状态利用状态​根据策略函数概率分布随机抽样下一步动作得到。但并不会真的让Agent执行。此时分别计算两个动作和状态下的动作价值函数的值以及使用TD算法计算差值计算价值网络的导数用TD算法更新价值网络的参数计算策略网络的导数用梯度上升算法更新策略网络的参数终极目标就是学习策略网络而其中的动作价值函数起辅助作用帮助训练策略网络。因此在训练好模型后我们主要是利用其中的策略函数来控制Agent执行什么动作。3. 动作价值函数和状态价值函数的意义3.1 Action-value function表示Agent在状态执行动作之后按照策略选择后续所有动作所能得到的未来累积回报的期望。3.2 State-value function表示Agent处于状态所有动作都按照策略采样执行所能得到的未来累积回报的期望。3.3 总结两者的核心区别就是动作价值函数是采取动作以后对来为累计期望回报的计算。而状态价值函数是在状态时未采用动作计算所有可能动作的价值然后按照加权平均计算未来累计期望回报。

相关新闻

林伽一 · AI科技日报 | 2026年08月22日

林伽一 · AI科技日报 | 2026年08月22日

AI产业今日同时呈现狂飙与裂隙:AWS把基础设施即代码(IaC)开发从每应用3-4周压缩到数分钟[① AWS ML Blog],Anthropic以650亿美元ARR筹备10月IPO[② AI Supremacy],宇树科技上市首日暴涨460%[③ The Rundown Robotics]。…

2026/8/23 7:03:38 阅读更多 →
第 26 节:虚拟机更改 U 盘分区信息 + 板子设置从 U 盘启动

第 26 节:虚拟机更改 U 盘分区信息 + 板子设置从 U 盘启动

虚拟机里:更改U盘分区信息 把sd卡通过读卡器,接入虚拟机里。 $ cd /media/yhai/b1c100cd-cc74-4e7f-acb8-f0d34c931ee8/ //接入虚拟机后自动识别的目录 yhaiyhai:~$ sudo parted /dev/sdc /*查看分区表 编号 起始点 结束点 大小 文件系统 名称 …

2026/8/23 7:03:38 阅读更多 →
用Vibe Coding复制和搬运一个小项目已经易如反掌

用Vibe Coding复制和搬运一个小项目已经易如反掌

刚好工作需要用到一个也是MIT协议开源的小工具,但它虽然可用,但是C语言写的,需要编译,而且release出来的也是exe文件,没有图形用户界面、不能预览。 这么好的工具,5年多前就停更太可惜了。他刚好发布在我正…

2026/8/23 7:03:38 阅读更多 →

最新新闻

图结构(Graph)如何重构智能体认知?从DAG规划到GraphRAG的技术拆解

图结构(Graph)如何重构智能体认知?从DAG规划到GraphRAG的技术拆解

图结构(Graph)如何重构智能体认知?从DAG规划到GraphRAG的技术拆解 摘要 当前LLM Agent在处理复杂现实任务时,常受限于非结构化数据的"语义迷雾"与上下文窗口的"记忆瓶颈"。本文基于前沿技术视角,深…

2026/8/23 8:43:35 阅读更多 →
从CPU到AI:用操作系统存储哲学,治疗Agent的“失忆症“

从CPU到AI:用操作系统存储哲学,治疗Agent的“失忆症“

从CPU到AI:用操作系统存储哲学,治疗Agent的"失忆症" 目录 引言:当AI Agent患上"金鱼脑"一、问题对齐:Agent记忆 vs. OS存储二、架构设计:构建Agent的三级存储金字塔 2.1 三级存储架构2.2 记忆映射…

2026/8/23 8:43:35 阅读更多 →
数学建模实战:基于仿真优化的停车策略分析与SPSSPRO应用

数学建模实战:基于仿真优化的停车策略分析与SPSSPRO应用

1. 项目概述:从停车难题到数学建模的实战解析 停车,这个看似日常的行为,背后其实隐藏着复杂的空间优化与决策问题。尤其是在大型商场、交通枢纽或老旧小区,高峰期“一位难求”的窘境,不仅考验着驾驶者的耐心&#xff0…

2026/8/23 8:43:35 阅读更多 →
Java实习面试全流程解析与备战策略

Java实习面试全流程解析与备战策略

1. 项目概述:Java实习面试全流程解析去年秋招季,我以应届生身份参加了15家互联网公司的Java实习岗位面试,最终收获8个offer。这段经历让我深刻体会到——Java实习面试是一场系统性工程,需要从技术栈、项目经验、算法能力三个维度进…

2026/8/23 8:43:35 阅读更多 →
C++数组与哈希思想实战:从余数统计到算法优化

C++数组与哈希思想实战:从余数统计到算法优化

1. 从“余数个数”问题切入:理解数组与哈希思想的初次碰撞最近在辅导一些刚接触算法竞赛的同学时,发现一个挺有意思的现象:很多朋友对“数组”这个数据结构的理解,还停留在“一个能装很多变量的盒子”这个层面。一旦遇到“统计数组…

2026/8/23 8:43:35 阅读更多 →
APEX框架:打造制造业自适应AI智能体的三层自进化架构

APEX框架:打造制造业自适应AI智能体的三层自进化架构

1. 项目概述:当AI智能体走进生产车间最近和几个在制造业做数字化转型的朋友聊天,大家普遍有个痛点:生产线上的AI智能体,刚上线时表现还行,但产线一换、产品型号一变,或者设备参数稍有调整,模型性…

2026/8/23 8:42:35 阅读更多 →

日新闻

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/23 0:00:50 阅读更多 →
SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/23 0:00:50 阅读更多 →
Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/23 0:00:50 阅读更多 →

周新闻

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/23 0:00:50 阅读更多 →
SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/23 0:00:50 阅读更多 →
Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/23 0:00:50 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/22 18:08:39 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/22 7:31:03 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/22 3:22:48 阅读更多 →