1X) 特殊 BPDU STP (802.1D) 指标链路层(L2) 生成树协议,防止环路 注意:这些协议并非都是网络层协议。
强化学习中,不能像普通监督学习一样,单纯认为 loss 越低 = 模型越好!。
所以这里有一个规律,KL 越高 → 策略改动越大 → 更多样本触发裁剪 → clip_fraction 上升。
第二个问题:AI 以后会不会"真的"理解?这是一个更深层的问题。我们在第 12 篇里提到过,Yann LeCun(图灵奖得主、Meta 首席 AI 科学家)认为大语言模型是"通往 AGI 的一条岔路"。