0x00 ಸಾರಾಂಶ
ಈ ಸರಣಿಯ ಉದ್ದೇಶವು OpenClaw-RL ನ ಮೂಲ ಕೋಡ್ನಿಂದ ಕಲಿಯುವುದು ಮತ್ತು ಕಲಿಕೆಯನ್ನು ಬಲಪಡಿಸಲು ಕೆಲವು ಸಂಬಂಧಿತ ಪರಿಕಲ್ಪನೆಗಳು ಮತ್ತು ಆಲೋಚನೆಗಳನ್ನು ಸೆಳೆಯುವುದು. ಆದ್ದರಿಂದ, ಕೆಲವು ಮೂಲಭೂತ ಜ್ಞಾನ, ವಿಸ್ತರಣೆ ಮತ್ತು ವಿಸ್ತರಣೆ ಇರುತ್ತದೆ, OpenClaw-RL ಕೇವಲ ಒಂದೇ ಕತ್ತರಿಸುವ ಹಂತವಾಗಿದೆ. ಇದಲ್ಲದೆ, ಸಂಪೂರ್ಣ ಸರಣಿಯು ಸಂಪೂರ್ಣವಾಗಿರುವುದರಿಂದ, ಕೆಲವು ಪರಿಕಲ್ಪನೆಗಳು ವಿಭಿನ್ನ ಲೇಖನಗಳಲ್ಲಿ ಕಾಣಿಸಿಕೊಳ್ಳುತ್ತವೆ ಮತ್ತು ದಯವಿಟ್ಟು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಿ.
OpenClaw-RL ಎನ್ನುವುದು ಆನ್ಲೈನ್ ಬಲವರ್ಧನೆಯ ಕಲಿಕೆಗೆ (ಆನ್ಲೈನ್ RL) ಒಂದು ಚೌಕಟ್ಟಾಗಿದೆ, ನಿರ್ದಿಷ್ಟವಾಗಿ ಬುದ್ಧಿವಂತ ಪರಿಕರ ಬಳಕೆಯ ಸನ್ನಿವೇಶಗಳಿಗಾಗಿ. ಇದು ಪರಿಸರ ಪ್ರತಿಕ್ರಿಯೆಯಿಂದ ಪ್ರಕ್ರಿಯೆಯ ಪ್ರತಿಫಲ ಸಂಕೇತಗಳನ್ನು ಹೊರತೆಗೆಯುವ ಮೂಲಕ ಭಾಷಾ ಮಾದರಿಗಳಿಗೆ ತರಬೇತಿ ನೀಡುತ್ತದೆ ಮತ್ತು ಮೂರು ಮುಖ್ಯ ವಿಧಾನಗಳನ್ನು ಬೆಂಬಲಿಸುತ್ತದೆ:
- openclaw-rl: 二元发动的技数学乐(ಬೈನರಿ RL / GRPO)
- openclaw-opd: ಆನ್-ಪಾಲಿಸಿ ಡಿಸ್ಟಿಲೇಷನ್, OPD
- ಓಪನ್ಕ್ಲಾ-ಸಂಯೋಜಿತ:电影核机,在上明PPO最佳中下载下载 RL ಬಹುಮಾನ ಮತ್ತು OPD ಶಿಕ್ಷಕರ ಸಂಕೇತ

0x01 GRPO ಬೇಸ್
GRPO (ಗ್ರೂಪ್ ರಿಲೇಟಿವ್ ಪಾಲಿಸಿ ಆಪ್ಟಿಮೈಸೇಶನ್) ಮೂಲ ಕಲ್ಪನೆ: ಮೌಲ್ಯದ ಮಾದರಿಯ ಅಗತ್ಯವಿಲ್ಲ,
Standard PPO: 需要训练一个 V(s) → advantage = R - V(s)
GRPO: 同题生成 N 个回答 → advantage = R_i - mean(R)
(你的分数 - 班级平均分)
1.1 GRPO 解读
我们通俗解读下GRPO。
ನೀವು 学校电影文。 学校电影文。 ಶಿಕ್ಷಕರು ನಿಮಗೆ ಅದೇ ರೀತಿ ಮಾಡಲು ಅವಕಾಶ ಮಾಡಿಕೊಡಿ ಎಂದು ಊಹಿಸಿಕೊಳ್ಳಿ
PPO
普通教连(PPO): ಶಿಕ್ಷಕರು “ಸ್ಕೋರಿಂಗ್ ಪರಿಣಿತರನ್ನು” ಹೊಂದಿರುತ್ತಾರೆ, ಈ ಪರಿಣಿತರು ಭವಿಷ್ಯ ನುಡಿಯುತ್ತಾರೆ”这篇可以能分”几分手机”后ನೀವು ಮಾತ್ರ ಗಮನ ಕೊಡಬೇಕು”比 ತಜ್ಞ ಮುನ್ಸೂಚನೆ 好好少小”.但请电影很很贵—ನೀವು ದೊಡ್ಡ “ಸ್ಕೋರಿಂಗ್ ಮೆದುಳು” ಹೊಂದಿರುತ್ತೀರಿ.
ವಿವರಗಳು ಈ ಕೆಳಗಿನಂತಿವೆ.
- ಗುರಿ: ವಿದ್ಯಾರ್ಥಿಗಳು ಉತ್ತಮ ಬರವಣಿಗೆಯನ್ನು ಬರೆಯಲು ಕಲಿಯಲಿ, ಹೆಚ್ಚಿನ ಅಂಕಗಳನ್ನು ಪಡೆಯಿರಿ (ಉದಾಹರಣೆಗೆ 作文得高分, ಶಿಕ್ಷಕರ 表扬 ಪಡೆಯಿರಿ).
- ತಂತ್ರದ ವ್ಯಾಖ್ಯಾನ: ತಂತ್ರವು ವಿದ್ಯಾರ್ಥಿಯ ಬರವಣಿಗೆಯಾಗಿದೆ“可件”新教事,可以作文题目后按电影思路电影电影的设计』
- ಡೇಟಾವನ್ನು ಸಂಗ್ರಹಿಸಿ: ವಿದ್ಯಾರ್ಥಿಗಳಿಗೆ ಅವರ ಪ್ರಸ್ತುತ ಬರವಣಿಗೆಯ ಅಭ್ಯಾಸವನ್ನು ತಿಳಿಸಿ, ಹಲವಾರು ಲೇಖನಗಳನ್ನು ಬರೆಯಿರಿ, ಪ್ರತಿ ಲೇಖನದ ಬರವಣಿಗೆಯನ್ನು ರೆಕಾರ್ಡ್ ಮಾಡಿ, ವಸ್ತುವನ್ನು ಬಳಸಿ ಮತ್ತು ಅಂತಿಮ ಸ್ಕೋರ್ (ಬಹುಮಾನ).
- ಅಂದಾಜು 好坏(ಅನುಕೂಲಗಳು): 共篇作文(或可电影电影电视)比学院“平常名号手机”好多少 (ಅತ್ಯುತ್ತಮ ಸ್ಕೋರ್ಗಳು).
- 手机电影的难点:ಒಮ್ಮೆ ಬರವಣಿಗೆಯು ವಿಲಕ್ಷಣವಾಗಿದ್ದರೆ, ಅದನ್ನು ತುಂಬಾ ಬದಲಾಯಿಸಬಹುದು.
PPO ಕೋರ್ ಕೌಶಲ್ಯಗಳು:
- 新思路、新核校) = 写出设计作文电影电影/旧电影电视写出设计作文电出设计作文
- ಬರವಣಿಗೆಯ ವಿಧಾನವು ತುಂಬಾ ದೊಡ್ಡದಾಗಿದ್ದರೆ, ಗುರಿ ಕಾರ್ಯದ ಕೊಡುಗೆಯನ್ನು ನವೀಕರಿಸಲಾಗುವುದಿಲ್ಲ.
ಪ್ರಕ್ರಿಯೆಯ ಹಂತಗಳನ್ನು ಸರಳಗೊಳಿಸಿ:
- ಕೆಲವು ಮಾಹಿತಿಯನ್ನು ಸಂಗ್ರಹಿಸಿ
- ಪ್ರತಿ ಬರವಣಿಗೆಯ ಪ್ರಯೋಜನಗಳನ್ನು ಲೆಕ್ಕಾಚಾರ ಮಾಡುವುದು (ಅಥವಾ ಪ್ರತಿ ಬರವಣಿಗೆ ಲಿಂಕ್)
- 用带裁剪电影电影电影电影的电视的手机:可以耶老高分的思路设计,但裁剪掉过于匑张的思路总述。
- ಮೇಲಿನ ಹಂತಗಳನ್ನು ಪುನರಾವರ್ತಿಸಿ.
ಅನುಕೂಲಗಳು:
- ಸರಳ, ಸ್ಥಿರ, ಸುಲಭವಲ್ಲ ಏಕೆಂದರೆ ಒಮ್ಮೆ ಬರವಣಿಗೆಯ ವಿಧಾನವನ್ನು ಹೆಚ್ಚು ಮಾರ್ಪಡಿಸಿದರೆ, ಅದು ಬರವಣಿಗೆಯ ಗುಣಮಟ್ಟಕ್ಕೆ ಕಾರಣವಾಗುತ್ತದೆ ಮತ್ತು ಇದು ಅನೇಕ ರೀತಿಯ ಬರವಣಿಗೆ ಮತ್ತು ಕಲಿಕೆಗೆ ಸೂಕ್ತವಾಗಿದೆ.
GRPO
GRPO = “自由跟自电比,好家多学,差的少学”.
GRPO ವಿಧಾನ: 不请安全。 ಆದರೆ ನೇರವಾಗಿ ನಿಮ್ಮ ಸ್ವಂತ ಬರವಣಿಗೆಯನ್ನು ಹೋಲಿಸಿ 8 篇:
题目:"我最喜欢的动物"
作文1:得了 90 分
作文2:得了 60 分
作文3:得了 85 分
作文4:得了 70 分
...
平均分 = 76 分
ನಂತರ GRPO ಹೇಳಿದರು:
- 作文1(90分): 比合合高 14 分 → “这篇写得好,向多多像以写” ☑
- 作文2(60分):比合合低16 分 → “这篇写得差,向别别了内写” ☒
- 作文3(85分): 比合合高 9 分 → “还这个,运动多学学” ☑
ಕೋರ್ ಥಿಂಕಿಂಗ್: “ಸಂಪೂರ್ಣ ಮಾನದಂಡ” ಅಗತ್ಯವಿಲ್ಲ, ಕೇವಲ ತನ್ನನ್ನು ತಾನೇ ಅಗತ್ಯವಿದೆ.
ಸಂಬಂಧಿತ ಗುಂಪುಗಳು
我们叫叫 “ಸಂಬಂಧಿ ಗುಂಪು”?
- ಗುಂಪು: 用用8 篇作文 ಒಂದು “用”
- ಸಂಬಂಧಿ; ಇನ್ನೂ能分辨”哪篇没以生生”,海朝朝上电影电影。
1.2 ಡೀಪ್ಸೀಕ್ R1 ನ GRPO ವಿನ್ಯಾಸ
ಪ್ರಮುಖ ಅಂಶಗಳು:
- ಪರಿಶೀಲಿಸಬಹುದಾದ ಬಹುಮಾನ: 答案对/错,数学不撒达
- ಗುಂಪು
- ವಿಮರ್ಶೆ: 用组内 用组内电影于代乐了分ಕಾರ್ಯ ಮೌಲ್ಯ
#标准GRPO(DeepSeekMath /R1)
for prompt p:
responses=sample_N(policy,p,N=8)#同一 prompt 采样 N 次
rewards=[verify(r)for r in responses] #验证器打分 (0/1)
baseline= mean(rewards) #组内均值作为baseline
advantages=(rewards-baseline)/ std(rewards) #归-化
PPO_clip_update(policy,advantages)
ಪ್ರಕ್ರಿಯೆಯ ಸಾರಾಂಶ
Step 1: 采样 prompt
从 dataset 中取一个 prompt q
Step 2: Group rollout
用当前策略 π_old 生成 N 个回答: {o_1, o_2, ..., o_N}
Step 3: 打分
对每个回答算 reward: {R_1, R_2, ..., R_N}
Step 4: 组内归一化 → advantage
μ = mean(R_1, ..., R_N)
σ = std(R_1, ..., R_N)
A_i = (R_i - μ) / σ ← "你比平均好多少个标准差"
Step 5: PPO 更新
对每个回答 o_i 的每个 token t:
r_t = π_new(a_t|s_t) / π_old(a_t|s_t)
L_t = -min(r_t · A_i, clip(r_t) · A_i)
更新 θ_new = θ_old - lr · ∇L
ವಿವರವಾದ ಪ್ರಕ್ರಿಯೆ

1.3 GRPO ವಿರುದ್ಧ ಬೇಸ್ಲೈನ್
ಬೇಸ್ಲೈನ್ಗಿಂತ ಗುಂಪು ಏಕೆ ಉತ್ತಮವಾಗಿದೆ?
ಸಾಂಪ್ರದಾಯಿಕ ವಿಧಾನ (ಬಲವರ್ಧಿತ ಮತ್ತು ಮೂಲಭೂತ):
- ಒಂದು V(ಗಳು) 网络来 ಅಂದಾಜು ಬೇಸ್ಲೈನ್ಗೆ ತರಬೇತಿ ನೀಡುವ ಅಗತ್ಯವಿದೆ
- ವಿ(ಗಳು) 设计不可件 → ಮೂಲ 不圆 → ಅನುಕೂಲ 有偏
GRPO ವಿಧಾನ:
0x02 OpenClaw-RL GRPO ಅಳವಡಿಸಲಾಗಿದೆ
OpenClaw Binary RL:可以GRPO,实的PPO-ಕ್ಲಿಪ್ + REINFORCE式Advantage。即, OpenClaw Binary RL时代不是纯PPO,实说纯GRPO,实说纯GRPO,
2.1 ಒಟ್ಟಾರೆ ಹೋಲಿಕೆ
ಸ್ಟ್ಯಾಂಡರ್ಡ್ PPO vs ಸ್ಟ್ಯಾಂಡರ್ಡ್ GRPO vs OpenClaw ಈ ಕೆಳಗಿನಂತೆ ಹೋಲಿಕೆ ಮಾಡಿ:
| PPO ಮಾನದಂಡ | GRPO ಮಾನದಂಡ | OpenClaw ಬೈನರಿ RL | |
|---|---|---|---|
| ಮೂಲ ಪ್ರಯೋಜನ | GAE(r,V) (ವಿಮರ್ಶೆಯ ಅಗತ್ಯವಿದೆ) | 组可以归一化 | 玻璃用reward校量 (单条 ತಿರುವು, ±1/0) |
| ಮೂಲಭೂತ | ವಿ(ಗಳು) (ನಿರ್ಣಾಯಕ) | ಗುಂಪು ಸರಾಸರಿ/ಎಸ್ಟಿಡಿ | 无 ಮೂಲ (ಅಥವಾ ಅಂದಾಜು ಬ್ಯಾಚ್ ಎಂದರೆ) |
| ರಾಜಕೀಯ ನಷ್ಟ | PPO ಕ್ಲಿಪ್ ε=0.2 | PPO ಕ್ಲಿಪ್ ε=0.2 | PPO ಕ್ಲಿಪ್ ε=0.2, ε_high=0.28 |
| ಕೆಎಲ್ ನಿರ್ಬಂಧಗಳು | 有 (ಕ್ಲಿಪ್ ಮೂಲಕ ಮರೆಮಾಡಲಾಗಿದೆ) | 有 (ಕ್ಲಿಪ್ ಮೂಲಕ ಮರೆಮಾಡಲಾಗಿದೆ) | 无 (–kl-coef 0.0) |
| ನೆಟ್ವರ್ಕ್ ಟೀಕೆ | ಅಗತ್ಯವಿದೆ | ಅಗತ್ಯವಿಲ್ಲ | ಅಗತ್ಯವಿಲ್ಲ |
2.2 ಏಕೆ PPO ಅಲ್ಲ
OpenClaw ಬೈನರಿ RL ಪ್ರಮಾಣಿತ PPO(带 Critic 的) ಅನ್ನು ಪೂರೈಸುವುದಿಲ್ಲ.
ಸಂಪೂರ್ಣ PPO ಅವಶ್ಯಕತೆಗಳು:
- ① ಸ್ವತಂತ್ರ ನಿರ್ಣಾಯಕ ನೆಟ್ವರ್ಕ್ ಅಂದಾಜು(ಗಳು)
- ②GAE (ಸಾಮಾನ್ಯೀಕೃತ ಅಡ್ವಾಂಟೇಜ್ ಅಂದಾಜು): A_t=δ_t+γλδ_{t+1} + …,
- ③ ಮೌಲ್ಯದ ನಷ್ಟ 结果 ಟೀಕೆ
PPO ಭಾಗ
PPO ಕ್ಲಿಪ್ ನಷ್ಟ ಕಾರ್ಯವನ್ನು ಎಲ್ಲಾ ಮೂರು ವಿಧಾನಗಳಿಂದ ಬಳಸಲಾಗುತ್ತದೆ,即PPO用行的名字:ಕಂಪ್ಯೂಟ್ _policy_loss,ಮೂರು ವಿಧಾನಗಳನ್ನು ಅಂತಿಮವಾಗಿ ಈ ಕಾರ್ಯಕ್ಕಾಗಿ ಬಳಸಲಾಗುತ್ತದೆ. ನವೀಕರಿಸಿದ ನೀತಿ ಕೋಡ್ PPO-ಶೈಲಿಯ ಕ್ಲಿಪ್ ಟಾರ್ಗೆಟ್ ಬದಲಿಯಾಗಿದೆ:
ratio = exp(log T_new -log T_old)
pg_loss = -min(ratio * adv, clip(ratio,1-e,1+e_high) * adv)
ಆದರೆ ಇದು ಕೇವಲ “PPO ಕ್ಲಿಪ್ ಕೌಶಲ್ಯಗಳು”,即PPO ಕ್ಲಿಪ್ ನಷ್ಟ (情件性权重比截断), PPO ಪೂರ್ಣಗೊಂಡಿಲ್ಲ.
即,OpenClaw ಬಳಕೆ = ಬಲವರ್ಧನೆ ತರಹದ ಪ್ರಯೋಜನ + PPO-ಶೈಲಿಯ ನವೀಕರಣ:
- ಪ್ರಯೋಜನ = ಕಚ್ಚಾ ಪ್ರತಿಫಲ (± 1) → ಹೊರಸೂಸುವಿಕೆ 到成动jeton
- ಅಪ್ಡೇಟ್ ನೀತಿ = PPO ಕ್ಲಿಪ್
但PPO ಇತರ ಭಾಗ“(ನಿರ್ಣಾಯಕ ನೆಟ್ವರ್ಕ್/ಮೌಲ್ಯ, GAE ಪ್ರಯೋಜನ, TD ರಿಟರ್ನ್)
PPO未用到设计
ಇನ್ನೂ ಬಳಸದ PPO ಭಾಗಗಳು ಈ ಕೆಳಗಿನಂತಿವೆ:
| PPO ಮೂಲ ಘಟಕಗಳು | ಸ್ಥಿತಿ | ಕಾರಣ |
|---|---|---|
| ನಿರ್ಣಾಯಕ (ಮೌಲ್ಯ ಜಾಲ) | ಬಳಕೆಯಾಗಿಲ್ಲ | ಅನುಕೂಲತೆ_ಅಂದಾಜು |
| GAE (λ-ರಿಟರ್ನ್) | ಬಳಕೆಯಾಗಿಲ್ಲ | ಯಾವುದೇ ಕಾರ್ಯ ಮೌಲ್ಯ 就 英语设计 GAE ಇಲ್ಲ |
| ಟಿಡಿ-ಶೈಲಿಯ ರಿಟರ್ನ್ | ಬಳಕೆಯಾಗಿಲ್ಲ | 同上 |
| KL ಪೆನಾಲ್ಟಿ (ರೆಫ್ ಮಾದರಿಯ ವಿರುದ್ಧ) | ಬಳಕೆಯಾಗಿಲ್ಲ | –kl-coef 0.0(ಕೋಡ್ 293-296 行:kl_coef==0 → kl=[zeros]) |
| ಪ್ರತಿಫಲ ಸಾಮಾನ್ಯೀಕರಣ | ಬಳಕೆಯಾಗಿಲ್ಲ | –ನಿಷ್ಕ್ರಿಯಗೊಳಿಸು-ಬಹುಮಾನಗಳು-ಸಾಮಾನ್ಯೀಕರಣ |
PPO ಮಾಡ್ಯೂಲ್ ಕರೆ ಲಿಂಕ್
PPO ಮಾಡ್ಯೂಲ್ಗಳ ಮೂರು ವಿಧಾನಗಳು ಈ ಕೆಳಗಿನಂತಿವೆ:
Binary RL:
Slime主循环
→ compute_advantages_and_returns(advantage_estimator="grpo")
→ get_grpo_returns() [advantage =reward 标量广播]
→ policy_loss_function()(Slime默认)
→ compute_policy_loss(ppo_kl,grpo_adv,e=0.2,e_high=0.28) ← PPO clip
OPD:
Slime主循环
→ compute_advantages_and_returns(advantage_estimator="on_policy_distillation")
→ advantages =teacher_lp-student_lp [per-token]
→ policy_loss_function()(Slime默认)
→ compute_policy_loss(ppo_kl,opd_adv,e=0.2,e_high=0.2) ← PPO clip (symmetric, OPD does not pass --eps-clip-high)
Combine:
Slime主循环
→ compute_advantages_and_returns() ← 计算grpo_adv(存入batch["advantages"])
→ combine_loss_function()(自定义,绕过Slime默认loss)
→ teacher_adv=teacher_lp-rollout_lp
→ combined_adv=w_opd *teacher_adv+w_rl*grpo_adv
→ compute_policy_loss(ppo_kl,combined_adv,e=0.2,e_high=0.28) ← PPO clip
ಅನುಕೂಲಗಳನ್ನು ಹೋಲಿಸಲು 3 ಮಾರ್ಗಗಳು
# ::compute_advantages_and_returns()
if args.advantage_estimator in ["grpo","gspo"]: # BinaryRL使用
returns = get_grpo_returns(rewards,kl) # 标量reward广播
elif args.advantage_estimator =="on_policy_distillation":# OPD 使用
advantages =[teacher_lp -student_lp for...] #per-token教师差
# Combine:完全绕过上面所有分支
# → 使用combine_loss.py::combine_loss_function()直接计算combined_adv
# → 不进入compute_advantages_and_returns()
2.3 ಇದು ಏಕೆ 纯GRPO ಅಲ್ಲ
纯GRPO
ಜಿಆರ್ಪಿಒ ಸ್ಥಿತಿ:
- 电影: 下载ಪ್ರಾಂಪ್ಟ್ 电影G条下载completion,即GRPO 的 通过:下载ಪ್ರಾಂಪ್ಟ್ 全用可以,做组内。
- ಉಲ್ಲೇಖ: ಅನುಕೂಲ =(reward_i-mean (ಗುಂಪು))/std (ಗುಂಪು)
ಸಂಘರ್ಷದ ಸ್ವರೂಪ
而OpenClaw ಸನ್ನಿವೇಶದ ಪ್ರಕೃತಿ ಸಂಘರ್ಷ: GRPO ಅನ್ನು ಅನ್ವೇಷಿಸಬೇಕಾಗಿದೆ(多最发), ಆನ್ಲೈನ್ ಸೇವೆಯನ್ನು ನಿರ್ಧರಿಸುವ ಅಗತ್ಯವಿದೆ(只朡)一杤).
DeepSeek R1:
"What is 1764's square root?" × 8 → 比较哪些 response 正确
↑ 8条中有对有错,自然有对比
ಓಪನ್ ಕ್ಲಾ:
OpenClaw ಇದನ್ನು ಮಾಡಲು ಸಾಧ್ಯವಿಲ್ಲ: ಬಳಕೆದಾರರು ಸಂದೇಶವನ್ನು ಹಂಚಿಕೊಳ್ಳುತ್ತಾರೆ → ಕೇವಲ ಒಂದು ನೈಜ ಸಂದೇಶವನ್ನು ಪುನರುತ್ಪಾದಿಸಲು ಸಾಧ್ಯವಿಲ್ಲ (“ಪುನರುತ್ಪಾದಿಸಲು” ಸಾಧ್ಯವಿಲ್ಲ), ಸಂವಾದವು ನೈಜ ಸಮಯವಾಗಿದೆ, ಬ್ಯಾಚ್ ಮಾದರಿಯನ್ನು ಮಾಡಲಾಗುವುದಿಲ್ಲ.
用户A:"帮我写一封邮件" → 只有1条真实 response
用户B:"解释一下量子纠缠" → 只有1条真实 response
不能为了做 GRPO 而生成8条 "fake responses" 给真实用户!
即:

OpenClaw ಈ ಅಂತರವನ್ನು ಹೇಗೆ ಮಾಡುವುದು?
OpenClaw 借用了 DeepSeek R1 ನ GRPO ಫ್ರೇಮ್ವರ್ಕ್(PPO ಕ್ಲಿಪ್ + 无 ವಿಮರ್ಶಕ), 但把”可设计数学电影+结内数数”替迠迊审替込成替込成替运替迊审替里降颜”.ಇದು GRPO ಅನ್ನು “闅卷考发”(数字有标用答案) ನಿಂದ “开卷试语”(无标磁答案) 的替灠 ಗೆ ಪರಿವರ್ತನೆಯಾಗಿದೆ.
DeepSeek R1的 group normalization(组内对比)
OpenClaw的 majority vote(跨时间对比)
DeepSeek R1:8条同prompt response → 组内相对排名
OpenClaw:3次独立judge评分 → 投票取多数
DeepSeek R1:方差来源 = 生成随机性(可控)
OpenClaw:方差来源 = judge的不确定性 + 用户行为的多样性(噪声更大)
2.4 GRPO ಪ್ರಯೋಜನಗಳ ಸಂಪೂರ್ಣ ಸಾಕ್ಷಾತ್ಕಾರ
2.3 ನಾವು OpenClaw GRPO 因 N=1 退化的带 PPO ಕ್ಲಿಪ್ 的 REINFORCE ಎಂದು ತೀರ್ಮಾನಿಸುತ್ತೇವೆ.
如何电影
OpenClaw ನ GRPO ಮಾನದಂಡವನ್ನು ಹೆಚ್ಚು ಸರಳಗೊಳಿಸಲಾಗಿದೆ: GRPO ಅನುಕೂಲ = ಪ್ರತಿಫಲ ಪ್ರಮಾಣವು ಸಂಪೂರ್ಣ ಪ್ರತಿಕ್ರಿಯೆಗೆ ಸಮವಾಗಿ ಪ್ರಸಾರವಾಗುತ್ತದೆ. ಪ್ರಮುಖ ನಿಯತಾಂಕಗಳು --disable-rewards-normalization ಬ್ಯಾಚ್ ಅನ್ನು ಮುಚ್ಚಿ 内归一化,ಪ್ರತಿಫಲಗಳು ಮೂಲ ±1,不做 (r - mean) / std ಹ್ಯಾಂಡಲ್
# ppo_utils.py
# reward = +1.0
# response = [token_1, token_2, ..., token_T]
# grpo_advantages = [+1.0, +1.0, ..., +1.0] # T 个值完全相同
# slime/slime/utils/ppo_utils.py 中的 get_grpo_returns():
def get_grpo_returns(rewards: torch.Tensor, kl: list[torch.Tensor]):
returns = []
for i in range(len(rewards)):
returns.append(torch.ones_like(kl[i]) * rewards[i]) # 标量广播到所有 token,无 baseline
return returns
# 2. PPO clip (ppo_utils.py L125-134)
def compute_policy_loss(kl, advantages, eps_clip, eps_clip_high):
ratio = torch.exp(-kl) # π_new / π_old
pg_loss1 = -advantages * ratio # 无 clip
pg_loss2 = -advantages * torch.clamp(ratio,
1.0 - eps_clip, # 0.8
1.0 + eps_clip_high) # 1.28 (DAPO)
pg_loss = torch.max(pg_loss1, pg_loss2) # 取更保守的
N=1 退化
GRPO ಮಾನದಂಡಗಳು:A_i = (R_i - mean(R)) / std(R)N=1 ಯಾವಾಗ:A = (R - R) / 0 = 0/0 → 未教记!意作 OpenClaw ಪ್ರಯೋಜನವನ್ನು ಮುಚ್ಚುತ್ತದೆ 归一化,电影用 ಕಚ್ಚಾ ಬಹುಮಾನ:
advantages[i] = torch.ones_like(kl[i]) * rewards[i] # reward broadcast
# N=1 的 GRPO 本质上就是 REINFORCE + PPO clip:
# ∇L ≈ R · ∇log π(o | q) ← 纯 REINFORCE
# + clip 约束 ← PPO 的信任域
GRPO ಮಾನದಂಡದೊಂದಿಗೆ ಹೋಲಿಸಿದರೆ

OpenClaw ನ GRPO “结内数生” ನ ಈ ಪ್ರಮುಖ ಪ್ರಯೋಜನವನ್ನು ಕಳೆದುಕೊಂಡಿದೆ ಮತ್ತು ಇದು 带 PPO ಕ್ಲಿಪ್ 的 REINFORCE ಆಗಿ ಮಾರ್ಪಟ್ಟಿದೆ. ಇದು 带 PPO ಕ್ಲಿಪ್ಗೆ ಸಹ ಮುಖ್ಯವಾಗಿದೆ.
2.5 ನಷ್ಟ_ಮಾಸ್ಕ್ 与GRPO ಪ್ರಯೋಜನಗಳು
我们再视频最好的loss_mask。
ಮುಖವಾಡವನ್ನು ಹೊಂದಿಸುವ ತರ್ಕವು ಈ ಕೆಳಗಿನಂತಿರುತ್ತದೆ:
-
ಮಾನ್ಯ ಮಾದರಿ: 当 prm_score != 0 时,设计 loss_mask =True
-
ಅಮಾನ್ಯ ಮಾದರಿ: 当prm_score ==0时,ಸಾಮಾನ್ಯವಾಗಿ ನಷ್ಟ_ಮಾಸ್ಕ್ = ತಪ್ಪು ಹೊಂದಿಸಲಾಗಿದೆ
-
ವಿಶೇಷ ಕಾರ್ಯವಿಧಾನ: “ಕನಿಷ್ಠ ಒಂದು ಗ್ಯಾರಂಟಿ”
ಟೋಕನ್ ನಷ್ಟವನ್ನು ಮಾಲೀಕತ್ವದ ಟೋಕನ್ನ ಸಂಪೂರ್ಣ ಪ್ರತಿಕ್ರಿಯೆ ಅನುಕ್ರಮಕ್ಕೆ ಅನ್ವಯಿಸಲಾಗುತ್ತದೆ, ಮಾಲೀಕತ್ವದ ಟೋಕನ್ನಲ್ಲಿ ಮಾನ್ಯವಾದ ತರಬೇತಿ ಮಾದರಿಗಳನ್ನು ಮಾತ್ರ ಸೇರಿಸಲಾಗಿದೆ ಎಂದು ಖಚಿತಪಡಿಸುತ್ತದೆ
门控vs ನಿರ್ದೇಶನ
ನಷ್ಟ_ಮಾಸ್ಕ್ ಮತ್ತು GRPO ಅಡ್ವಾಂಟೇಜ್ ನಡುವಿನ ವ್ಯತ್ಯಾಸವು ಈ ಕೆಳಗಿನಂತಿದೆ:
ಅಂತಿಮ ನಷ್ಟ ಕೊಡುಗೆ: ಗ್ರೇಡಿಯಂಟ್ (ಟೋಕನ್ ಟಿ) = ನಷ್ಟ_ಮಾಸ್ಕ್ (ಟಿ) × ಪಾಲಿಸಿ_ಗ್ರೇಡಿಯಂಟ್ (ಅನುಕೂಲ (ಟಿ))
ತಾರ್ಕಿಕ ಮೌಲ್ಯ ಕೋಷ್ಟಕ:
- ನಷ್ಟ_ಮಾಸ್ಕ್ = 0 → ಗ್ರೇಡಿಯಂಟ್ = 0(ಅನುಕೂಲವಿಲ್ಲ, 门关了)
- ನಷ್ಟ_ಮಾಸ್ಕ್=1,ಅನುಕೂಲ > 0 →正向梯度,P(ಟೋಕನ್) ಏರುತ್ತದೆ
- loss_mask=1,ಅನುಕೂಲ <0 → 英向梯度,P(ಟೋಕನ್) ಕುಸಿತ
- ನಷ್ಟ_ಮಾಸ್ಕ್=1,ಅನುಕೂಲ ≈ 0 →近零梯度,P(ಟೋಕನ್) ಮೂಲಭೂತವಾಗಿ ಬದಲಾಗಿಲ್ಲ
OpenClaw ನ ವಿವರವಾದ ಮ್ಯಾಪಿಂಗ್
ಸ್ಕೋರ್→ ನಷ್ಟ_ಮಾಸ್ಕ್ + ಪ್ರತಿಫಲ ಸಂಪೂರ್ಣ ನಕ್ಷೆ:
- ನ್ಯಾಯಾಧೀಶರ ಸ್ಕೋರ್ = +1
- ನಷ್ಟ_ಮಾಸ್ಕ್ = [1] → ತರಬೇತಿಯನ್ನು ಒಳಗೊಂಡಿರುತ್ತದೆ
- ಪ್ರತಿಫಲ = +1.0→GRPO 电影出正 ಅನುಕೂಲ
- ಫಲಿತಾಂಶ: 被推高高公司(“ಇದನ್ನು ಮಾಡುವುದನ್ನು ಮುಂದುವರಿಸಿ”)
- ನ್ಯಾಯಾಧೀಶರ ಸ್ಕೋರ್=0(中性回复):
- ನಷ್ಟ_ಮಾಸ್ಕ್ =[0] → 在外 ಹೊರತುಪಡಿಸಿ
- ಪ್ರತಿಫಲ =0.0 → 不这些 ಅನುಕೂಲದ ಲೆಕ್ಕಾಚಾರ (ಏಕೆಂದರೆ ಅದನ್ನು ಹೊರಗಿಡಲಾಗಿದೆ)
- ಫಲಿತಾಂಶಗಳು: 零梯度,ಈ ನೀತಿಗೆ ಯಾವುದೇ ನವೀಕರಣವಿಲ್ಲ
- ನ್ಯಾಯಾಧೀಶರ ಅಂಕ =-1(差的回社):
- ನಷ್ಟ_ಮಾಸ್ಕ್ =[1]→ ತರಬೇತಿಯನ್ನು ಒಳಗೊಂಡಿರುತ್ತದೆ
- ಪ್ರತಿಫಲ =-1.0→GRPO 电影出者ಅನುಕೂಲ
- ಫಲಿತಾಂಶ: ಈ ತಿರುವಿನ ಮಾಲೀಕತ್ವದ ಟೋಕನ್ ಸಂಭವನೀಯತೆಯಾಗಿದೆ(“ಇದನ್ನು ಮಾಡಬೇಡಿ”)
ಲೋಳೆಯಲ್ಲಿ GRPO ಅಡ್ವಾಂಟೇಜ್ ಲೆಕ್ಕಾಚಾರ:
# advantages[i]=标量奖励广播到整个序列
advantages[i]= torch.ones_like(kl[i]) * rewards[i]
# rewards[i]=+1或-1(来自_sample.reward 字段)
# kl[i] 的形状 =(sequence_length,)
# torch.ones_like(kl[i])*rewards[i]=每个token都用同一个值
2.6 KL ನಷ್ಟ
我们再再视频, Kl_loss_coef=0(无KL) ಇನ್ನೂ ಸ್ಥಿರವಾಗಿದ್ದರೂ OpenClaw ನ ಪ್ರಸ್ತುತ GRPO ಕಾನ್ಫಿಗರೇಶನ್ ಏಕೆ?
ಕೆಎಲ್ ಸಂಪ್ರದಾಯ
ಸಾಂಪ್ರದಾಯಿಕ RLHF ನಲ್ಲಿ KL “ಸಾಮಾನ್ಯ ಭದ್ರತಾ ವಲಯ” ಅಲ್ಲ, ಇದು ನಿರ್ದಿಷ್ಟವಾಗಿದೆ:
| ಏನು? | 下载被GRPO ಸ್ವಯಂಚಾಲಿತವಾಗಿ ಪರಿಹರಿಸುತ್ತದೆ |
|---|---|
| 防 ಬಹುಮಾನ ಮಾದರಿ 被hack | ಇದು ಪ್ರತಿಫಲ ಅಥವಾ ಹ್ಯಾಕ್ ಅನ್ನು ಅವಲಂಬಿಸಿರುತ್ತದೆ |
| 防正视题自然评语流形 | GRPO 用 ಉಪ-ನೀತಿ ಮಾದರಿ + ಗುಂಪು ಸಾಮಾನ್ಯೀಕರಣ ಭಾಗಶಃ ಪರಿಹಾರ |
| 防设计利用性是不可(ಲೋಗ್ರಾಟಿಯೋ ಸ್ಫೋಟ) | PPO ಕ್ಲಿಪ್ ಈಗಾಗಲೇ ಅಸ್ತಿತ್ವದಲ್ಲಿದೆ |
| 防遗忘 ಉಲ್ಲೇಖ 电影 | ನೀವು ref ಸಾಮರ್ಥ್ಯವನ್ನು ಉಳಿಸಿಕೊಳ್ಳುವ ಅಗತ್ಯವಿಲ್ಲದಿದ್ದರೆ, ನೀವು ಅಗತ್ಯವಿಲ್ಲ |
ಓಪನ್ ಕ್ಲಾ-ಆರ್ಎಲ್
OpenClaw-RL ಯಾವಾಗ kl_loss_coef=0(无KL), ಇನ್ನೂ ಸ್ಥಿರವಾಗಿದೆ,ಏಕೆಂದರೆ 5 ಅಂಶಗಳ ಸಾಮಾನ್ಯ ಭದ್ರತೆ:
- PPO ಕ್ಲಿಪ್(0.2/0.28): ಹಂತ-ವಾರು ಟ್ರಸ್ಟ್ ಪ್ರದೇಶವನ್ನು ಒದಗಿಸುತ್ತದೆ
- GRPO ಶೂನ್ಯ-ಮೊತ್ತ: 组内 ಪ್ರಯೋಜನ
- 电影可以:ಬಾಹ್ಯ ಪ್ರಾಂಪ್ಟ್ ಪುನರಾವರ್ತನೆಯಾಗುವುದಿಲ್ಲ,天物所述ಎಂಟ್ರೋಪಿ
- ಸಣ್ಣ ತರಬೇತಿ: 36/24次 ಸಂವಾದಾತ್ಮಕ ದರ್ಜೆ, ಸೀಮಿತ ತಂತ್ರ
- ಮೋಡ್ ಕುಸಿತ
2.7 GRPO vs OPD
ಅಂತಿಮವಾಗಿ, GRPO vs OPD ಅನ್ನು ನೋಡೋಣ.
| ಹೋಲಿಸಿ | GRPO (ಬೈನರಿ RL) | ಒಪಿಡಿ |
|---|---|---|
| ಇನ್ಪುಟ್ ಮೂಲ | ಮಾದರಿ.ಬಹುಮಾನ ["score"](标量)ಉದಾ +1.0 / -1.0 |
model.teacher_log_probs(ವೆಕ್ಟರ್)ಉದಾ [-0.1, -0.3, -0.1, -0.2] |
| ಆಕಾರದ ಅನುಕೂಲ | [T] ಎಲ್ಲಾ ಒಂದೇ[+1, +1, +1, +1] | [T] ಪ್ರತಿ ಟೋಕನ್ ವಿಭಿನ್ನವಾಗಿರುತ್ತದೆ[+0.2, +0.9, 0.0, +0.6] |
| ಬಹುಮಾನ 归一化 | ಐಚ್ಛಿಕ (OpenClaw ನಿಷ್ಕ್ರಿಯಗೊಳಿಸಲಾಗಿದೆ)--disable-rewards-normalization |
ಅನ್ವಯಿಸುವುದಿಲ್ಲ |
| ಕೆಎಲ್ ಅವರ ಕಾರ್ಯ | get_grpo_returns 用 cl [i]ಬೆಂಚ್ಮಾರ್ಕ್ ಅನ್ನು ಅನುಗುಣವಾದ ಮೌಲ್ಯಕ್ಕೆ ನಕಲಿಸಿ, ಕೀಲಿಯ ಮೌಲ್ಯವು ಪ್ರಯೋಜನದ ಮೇಲೆ ಪರಿಣಾಮ ಬೀರುವುದಿಲ್ಲ | ಸಂಪೂರ್ಣವಾಗಿ ಅನುಪಯುಕ್ತadvantages = teacher - student |
| ಅನ್ವಯವಾಗುವ ಷರತ್ತುಗಳು | ಬಹುಮಾನಗಳು Noneloss_mask=[1] | Teacher_log_probs Noneloss_mask= ಅಲ್ಲ[1] |
| ಬಹುಮಾನ=0 时 | ಅನುಕೂಲ = [0, 0, …, 0]梯度的零,ಮಾದರಿ ಅಮಾನ್ಯವಾಗಿದೆ | ಅನ್ವಯಿಸುವುದಿಲ್ಲ (OPD 佢弃 ಬಹುಮಾನ=0 ಮಾದರಿಗಳು) |
ಲೋಳೆಯಲ್ಲಿ ಎರಡರ ಕಾರ್ಯದ ಪ್ರಯೋಜನವು ನಿರ್ದಿಷ್ಟ ಸ್ಥಳವಾಗಿದೆ
slime/backends/megatron_utils/loss.py: compute_advantages_and_returns()
├── if advantage_estimator == "grpo": <- Binary RL 使用
│ advantages = get_grpo_returns(rewards, kl)
│
└── elif advantage_estimator == "on_policy_distillation": <- OPD 使用
teacher_log_probs = [t_lp.to(device=device) for t_lp in teacher_log_probs] # ← 移动到正确设备
advantages = teacher_log_probs - student_log_probs
0x03 GRPO ನೊಂದಿಗೆ ಸಂಭಾಷಣೆ ದೃಶ್ಯ
OpenClaw-RL GRPO ನೊಂದಿಗೆ ಕಾರ್ಯನಿರ್ವಹಿಸದಿದ್ದರೂ, ನಾವು ಇನ್ನೂ ಅದರ ಮೇಲೆ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತಿದ್ದೇವೆ.
3.1 ಕೋರ್ ಸಂಘರ್ಷ ವಿಮರ್ಶೆ
- GRPO ಅಗತ್ಯವಿದೆ: ಅದೇ ಕ್ಷಿಪ್ರ → N 条 ಪ್ರತಿಕ್ರಿಯೆ → 组内数字
- ಸಂವಾದ ಸನ್ನಿವೇಶ: ಬಳಕೆದಾರರು 1 ಪ್ರತಿಕ್ರಿಯೆಯನ್ನು ಮಾತ್ರ ಪಡೆಯಬಹುದು → ಸಾಧ್ಯವಿಲ್ಲ”重放” ಅದೇ ಪ್ರಾಂಪ್ಟ್
3.2 ಯೋಜನೆ ಒಂದು
ಪರಿಹಾರ 1: ಸೆಷನ್ 内推生于”行组”
# 当前:每条 turn 的 advantage = reward(无 baseline)
advantages[i] = reward_i
# 改进:session 内历史均值作为 baseline
session_baseline = running_mean(session_rewards[session_id])
advantages[i] = reward_i - session_baseline
# 意义:
# 比本 session 历史平均好 → 正 advantage
# 比本 session 历史平均差 → 负 advantage
ಅನ್ವಯವಾಗುವ ದೃಶ್ಯ: ಅದೇ ಬಳಕೆದಾರರು ನಿರಂತರ ಸಂಭಾಷಣೆಯಲ್ಲಿದ್ದಾರೆ, ಸೆಷನ್ ತುಲನಾತ್ಮಕವಾಗಿ ಸ್ಥಿರವಾಗಿರುತ್ತದೆ
ಪ್ರಯೋಜನಗಳು: 在 OpenClaw, ಸೆಷನ್ ಹಿಸ್ಟರಿ 均值 ಮೂಲವು ಕಡಿಮೆ ವೆಚ್ಚದ ಸುಧಾರಣೆಯಾಗಿದೆ
ಮಿತಿ: ಅವಧಿ
3.3 ಯೋಜನೆ
ಪರಿಹಾರ
用户发送 query
↓
并行生成 N=4 条 candidate responses
↓
Judge 快速打分(轻量级,非 majority vote)
↓
选择得分最高的那条回复给用户
↓
用所有 N 条 + 对应 scores 做 GRPO group update
R = [+1, -1, 0, +1]
baseline = mean(R) = 0.25
advantages = [+0.75, -1.25, -0.25, +0.75]
ಪ್ರಯೋಜನಗಳು: 全电影电影 GRPO 语义;ಬಳಕೆದಾರರು ಉತ್ತಮ ಗುಣಮಟ್ಟದ ಸುಧಾರಣೆಯನ್ನು ಸಹ ನೋಡಬಹುದು (ಬೆಸ್ಟ್-ಆಫ್-ಎನ್ ಸೇವಾ ಗುಣಮಟ್ಟ ಸುಧಾರಣೆ)
ವೆಚ್ಚ: 推理 ವೆಚ್ಚ × N
3.4 ಯೋಜನೆ
ಪರಿಹಾರ 三:OPD ಮೂಲಭೂತವಾಗಿ ಈಗಾಗಲೇ N=2 的组内公司 ಹೊಂದಿದೆ
Response A:学生的原始回复(score = PRM eval)
Response B:Teacher hint 指出的"更好路径"
→ 两者比较 = teacher_lp - student_lp = OPD advantage
GRPO (N=8):advantages = [r_i - mean(r)] for 8 candidates
OPD (N=2):advantage
↑ ↑
"更好的回复" "实际给用户的回复"
OPD ಒಂದು ರೀತಿಯ ಗುಪ್ತ N=2 GRPO,是是”新条条条”是 ಶಿಕ್ಷಕರ ಲಾಗ್-ಪ್ರೋಬ್,而非电影电影的新条斂本本
3.5 ಯೋಜನೆ 4
ಪರಿಹಾರ: ಊಹಾತ್ಮಕ ಮಾದರಿ + GRPO
生成 response 时,用 draft model 生成 N 条 token-level candidates
Policy model 对每条 score → 组内 GRPO,只把接受的 token 序列发给用户
ವಿವರಣೆ: ಊಹಾತ್ಮಕ ಡಿಕೋಡಿಂಗ್ + RL
3.6 ತೀರ್ಮಾನ
实用程度 方案
-------------------------------------
最低改动 Session 历史均值作 baseline(加几行代码)
已经存在 OPD = 隐式 N=2 GRPO(无需改动)
最接近标准 GRPO Best-of-N + 选最优(推理成本翻 N 倍)
前沿方向 Speculative + GRPO(尚未工程化)
0x04 ಮರುಚಿಂತನೆ
我们由电影来来意思的—— “ಆರ್ಎಲ್ ಅನ್ನು ಉತ್ತಮಗೊಳಿಸುವಾಗ, ಗಮನವು PPO ಅಥವಾ GRPO ಅನ್ನು ಬಳಸುವುದರ ಮೇಲೆ ಮಾತ್ರವಲ್ಲ, ಆದರೆ ಮಾದರಿಯಿಂದ ಉತ್ಪತ್ತಿಯಾಗುವ ನಡವಳಿಕೆಯ ವಿತರಣೆಯ ಮೇಲೆ ನಿಯಂತ್ರಣವಿದೆಯೇ ಎಂಬುದರ ಮೇಲೆ.
即: PPO VS GRPO ಮೇಲಿನ ಪದರವಾಗಿದೆ, ವಿತರಣೆ ನಿಯಂತ್ರಣವು ಸಾರವಾಗಿದೆ
4.1 PPO/GRPO ಅನ್ನು ಮೇಲಿನ ಪದರವಾಗಿ ಏಕೆ ಆಯ್ಕೆ ಮಾಡಲಾಗಿದೆ?
PPO和GRPO ಅದೇ ಮೂಲಭೂತ ಸಮಸ್ಯೆಯನ್ನು ಪರಿಹರಿಸುತ್ತಿದೆ: “ಒಂದು ಬ್ಯಾಚ್ ಉಡಾವಣೆ ಮತ್ತು ಅನುಗುಣವಾದ ಪ್ರತಿಫಲವನ್ನು ನೀಡಲಾಗಿದೆ, ನೀತಿಯನ್ನು ಹೇಗೆ ನವೀಕರಿಸುವುದು 权重?”
- PPO 的电影:有电影电影(ವಿಮರ್ಶೆ)+ಕ್ಲಿಪ್+KL 古直
- GRPO ಸ್ಕೀಮ್: 用组统计使用baseline+clip(无 ನಿರ್ಣಾಯಕ)
ಆದರೆ ನೀವು ಯಾವುದನ್ನು ಬಳಸಿದರೂ, ಒಳ್ಳೆಯದು ಮತ್ತು ಕೆಟ್ಟ ತರಬೇತಿಯನ್ನು ನಿಜವಾಗಿಯೂ ನಿರ್ಧರಿಸುವುದು ಮೂರು ಆಳವಾದ ಮಟ್ಟದ ಪ್ರಶ್ನೆಗಳು, ಈ ಮೂರು ಪ್ರಮುಖ ಪ್ರಶ್ನೆಗಳು (ಅಲ್ಗಾರಿದಮ್ ಆಯ್ಕೆಗಿಂತ ಹೆಚ್ಚು ಮುಖ್ಯವಾಗಿದೆ):
-
① ತಂತ್ರವನ್ನು ಪ್ರಯೋಜನದ ದಿಕ್ಕಿನ ಪ್ರಕಾರ ಬದಲಾಯಿಸಬೇಕೇ?
-
② ಅಗಲದಲ್ಲಿ ಬದಲಾವಣೆ 多大?=步长水标题论(ಸ್ಕೇಲ್ ಸ್ಕೇಲ್)
-
③ ಅದೇ ಸಮಯದಲ್ಲಿ ಸ್ಥಿರತೆಯನ್ನು ಕಾಪಾಡಿಕೊಳ್ಳುವ ಸಾಮರ್ಥ್ಯವನ್ನು ಸುಧಾರಿಸುವುದು ಹೇಗೆ?
ಪ್ರಶ್ನೆ ①深解:梯度长记电影什么可以?
ಸಮಸ್ಯೆಯ ಸ್ವರೂಪ: ಪ್ರಯೋಜನವೇನು, ಯಾವ ದಿಕ್ಕನ್ನು ನವೀಕರಿಸಲಾಗಿದೆ?
ಪ್ರಶ್ನೆ ②深解:ಯಾವ ನಿಯಂತ್ರಣದಿಂದ ಅಗಲವನ್ನು ಬದಲಾಯಿಸಿ?
-
PPO ಕ್ಲಿಪ್ನ ಸ್ವರೂಪ: ಸಂಭವನೀಯತೆಯ ಅನುಪಾತವನ್ನು ಮಿತಿಗೊಳಿಸುತ್ತದೆ, ದೂರದ ನಿಯತಾಂಕಗಳನ್ನು ಮಿತಿಗೊಳಿಸುತ್ತದೆ
-
KL ಪೆನಾಲ್ಟಿ:
L_total =L_policy-β*KL(π_new l π_ref),电影电影新 ನೀತಿ与电影 ನೀತಿ的运动,比clip更“全线”,但 β ಹೊಂದಿಸುವ ಅಗತ್ಯವಿದೆ -
ಎಂಟ್ರೋಪಿ 正则化:L_total =L_policy+a *H(π_new)
-
学习环;
-
ಅಪ್ಡೇಟ್ 步数perbatch: ಒಂದೇ ಬ್ಯಾಚ್ ಡೇಟಾದ ಪುನರಾವರ್ತಿತ ಬಳಕೆಯ ಸಂಖ್ಯೆಯನ್ನು ಹೆಚ್ಚಿಸಿ
-
OpenClaw ಆಯ್ಕೆಗಳು:
- e=0.2,e_high=0.28(c1ip, relativistic宽松)
- –kl-coef0.0
- = ಕೇವಲ ಅವಲಂಬಿತ ಕ್ಲಿಪ್ ನಿಯಂತ್ರಣ 步长,ಇತರ ನಿರ್ಬಂಧಗಳು ಎಲ್ಲಾ ಮುಚ್ಚಲಾಗಿದೆ
- = ಸಂಬಂಧಿತ ನವೀಕರಣ ಮೋಡ್ (ಆನ್ಲೈನ್ ನೈಜ-ಸಮಯದ ಡೇಟಾ ಮತ್ತು ಬೆಂಬಲ)
4.2 ಪ್ರಶ್ನೆ: ಸ್ಥಿರತೆ ಎಲ್ಲಿಂದ ಬರುತ್ತದೆ?
ಸ್ಥಿರತೆಯನ್ನು “ಯಾವ ಅಲ್ಗಾರಿದಮ್” ನಿರ್ಧರಿಸುವುದಿಲ್ಲ, ಆದರೆ ಮೂರು ಷರತ್ತುಗಳ ಸಂಯೋಜನೆ:
ಕಂಡಿಶನ್ಎ: ಅಡ್ವಾಂಟೇಜ್ 方差 ನಿಯಂತ್ರಣ
ಸ್ಥಿತಿ B: 步长 ಇದು ಕಾರ್ಯ ರಚನೆಗೆ ಹೊಂದಿಕೆಯಾಗುತ್ತದೆಯೇ ಎಂಬ ನಿರ್ಬಂಧ
-
单轮手机 (数学题): ಕ್ಲಿಪ್ ε=0.2 名影要
-
长院迹 ಏಜೆಂಟ್ 杨京: 长通迹步长普件: ಸುಮಾರು ಎಂಟ್ರೊಪಿ 正则化
ಸ್ಥಿತಿ ಸಿ: ಸ್ಥಳಾಂತರದ ವಿತರಣೆಯನ್ನು ಮೇಲ್ವಿಚಾರಣೆ ಮಾಡಲಾಗುವುದಿಲ್ಲ
ಆಫ್-ನೀತಿ ಡೇಟಾವನ್ನು ತರಬೇತಿಗೆ ನಮೂದಿಸಲಾಗಿದೆ, ಶಿಫ್ಟ್ನ ದಿಕ್ಕು ನಿಖರವಾಗಿಲ್ಲ → ಅದನ್ನು ಸರಿಪಡಿಸದಿದ್ದರೆ, ಅದು ಸ್ಟೆಲೆನೆಸ್ ಫಿಲ್ಟರ್ ಆಗಿದೆ → ನವೀಕರಿಸಿ
小结
ಸ್ಥಿರತೆಯ ನಿಜವಾದ ಮೂಲ:ಅಡ್ವಾಂಟೇಜ್
4.3 ಪ್ರತಿ ತಾಂತ್ರಿಕ ಮಾರ್ಗದ ಮೂರು ಸಮಸ್ಯೆಗಳ ಮ್ಯಾಪಿಂಗ್
① 方向 (Advantage) ② 幅度 (Step Control) ③ 稳定性
─────────────────────────────────────────────────────────────────────────────────────
标准 PPO GAE (低方差) clip + KL 惩罚 critic 降噪
GRPO 组均值 (无 critic) clip only 简单但方差大
K1.5 LongRL GRPO 镜像梯度 + KL 正则 相对熵约束
K2.5 步骤级 GRPO token-level clip IS 修正
SAMPO REINFORCE++ 无 KL + entropy 监控 off-policy 修正
OpenClaw RL Turn-level scalar clip ε=0.2/0.28 只靠 clip
OpenClaw OPD teacher-student clip + distillation teacher 锚定
Combine GRPO + OPD 混合 clip + combined loss 两路互补

0xFF ಉಲ್ಲೇಖ
【设计学习】 ಸ್ಥಿರೀಕರಣ ಬಲವರ್ಧನೆಯ ಕಲಿಕೆ ಮತ್ತು LLMಗಳು: ಸೂತ್ರೀಕರಣ ಮತ್ತು ಅಭ್ಯಾಸ