让 AI 的目标和行为符合人类意图与价值的研究方向。
对齐像给代驾讲规矩:车技再好,也得把你送回家,不能顺路去撸串。
它用于训练、评测和治理模型,降低失控、作恶或误解指令的风险。
RLHF
RLHF 通过人类反馈让模型更接近 Alignment 目标。
AGI
AGI 提升了 Alignment 问题的复杂度和重要性。
AI-bias
AI-bias 是 Alignment 不充分时的现实表现之一。
AI-regulation
AI-regulation 从制度层面对 Alignment 形成补充。