五月天青色头像情侣网名,国产亚洲av片在线观看18女人,黑人巨茎大战俄罗斯美女,扒下她的小内裤打屁股

歡迎光臨散文網(wǎng) 會員登陸 & 注冊

【PPO × Family】第七課:挖掘黑科技 —— 探秘調(diào)優(yōu) PPO 的...

2023-06-07 14:15 作者:臉紅不及向日葵  | 我要投稿

不知不覺跟到第七節(jié)課了!老規(guī)矩,依舊是將老師提到的一些鏈接整理了出來?????♀?

?
12:34
?

有關(guān)于 GAE 完整的計算代碼示例以及其他計算 Advantage Function 的方法和 GAE 的對比,可以參考:

GAE代碼示例: https://opendilab.github.io/PPOxFamily/gae_zh.htm1

Advantage計算補充材料: https://github.com/opendilab/PPOxFamily/blob/main/chapter7_tricks/chapter7_supp_adv.pdf

?
13:57
?

關(guān)于 off-policy 和 PPO 相關(guān)的一些細節(jié),可以參考:

https://github.com/opendilab/PPOxFamily/blob/main/chapter7_tricks/chapter7_supp_offpolicy.pdf

?
16:01
?

Recompute 以及各種不同的 Shuffle 和相應的數(shù)據(jù)處理策略的對比參考這篇論文:

What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study: https://arxiv.org/pdf/2006.05990.pdf

?
20:01
?

Entropy 補充材料請參考:

https://github.com/opendilab/PPOxFamily/bleob/main/chapter7_tricks/chapter7_supp_entropy.pdf

?
25:46
?

Grad Clip 代碼示例參考:

https://opendilab.github.io/PPOxFamily/grad_clipzh.html

?
30:30
?

正交初始化代碼示例:

https://opendilab.github.io/PPOxFamily/onthogonal_init_zh.html

?
33:24
?

Dual Clip 代碼示例:

https://opendilab.github.io/PPOxFamily/dual_clip_zh.htnh

?
39:17
?

智能體性能的評價維度請參考以下論文:

?MEASURING THE RELIABILITY OF REINFORCEMENT LEARNING ALGORITHMS: https://openreview.net/pdf?id=SJlpYJBKvH

?
40:26
?

終于要講 LLM 了!小小期待一下!??

【PPO × Family】第七課:挖掘黑科技 —— 探秘調(diào)優(yōu) PPO 的...的評論 (共 條)

分享到微博請遵守國家法律
新巴尔虎左旗| 花莲市| 德庆县| 虞城县| 桐柏县| 湖州市| 临朐县| 双峰县| 蓬溪县| 扎兰屯市| 濉溪县| 铜鼓县| 清丰县| 资源县| 钟山县| 苍溪县| 丹阳市| 安溪县| 霞浦县| 余江县| 大连市| 呼伦贝尔市| 北碚区| 房山区| 民勤县| 若尔盖县| 仁化县| 兴宁市| 宝清县| 巍山| 防城港市| 安仁县| 将乐县| 新绛县| 宜君县| 汝阳县| 同仁县| 通山县| 新闻| 留坝县| 崇明县|