AI Rookies

Alignment — 对齐

事实

让 AI 的目标和行为符合人类意图与价值的研究方向。

人话

对齐像给代驾讲规矩:车技再好,也得把你送回家,不能顺路去撸串。

它用于训练、评测和治理模型,降低失控、作恶或误解指令的风险。

相关概念

RLHF
RLHF 通过人类反馈让模型更接近 Alignment 目标。

AGI
AGI 提升了 Alignment 问题的复杂度和重要性。

AI-bias
AI-bias 是 Alignment 不充分时的现实表现之一。

AI-regulation
AI-regulation 从制度层面对 Alignment 形成补充。