模型与机制 · 02-12
对齐(Alignment)
让模型行为更符合人类意图、价值、安全边界和任务要求的训练与约束过程。
对齐(Alignment)
让模型行为更符合人类意图、价值、安全边界和任务要求的训练与约束过程。
一、是什么
- 让模型行为更符合人类意图、价值、安全边界和任务要求的训练与约束过程。
- 类比:像让能力很强的员工不仅会做事,还知道哪些事不能做。
- 关键澄清:
| 它不是什么 | 它是什么 |
|---|---|
| 不是简单屏蔽敏感词 | 把能力、意图和安全边界拉到同一方向的系统工程 |
二、为什么重要
- 对齐决定模型是否可控、可用、可信。
- 不懂它会怎样:没有对齐,能力越强的模型越可能放大错误或风险。
三、日常怎么理解
- 用一句话讲给非技术朋友听:对齐就是让 AI 按人真正想要的方向做事。
- 常见场景:拒绝危险请求、遵守格式、减少有害输出、符合用户目标。
四、常见误解
| 误解 | 真相 |
|---|---|
| 对齐会让模型变笨 | 好的对齐是在能力和边界之间做平衡。 |
五、延伸阅读
- 本知识库相关:AI安全、模型偏见
- NIST AI Risk Management Framework
- OpenAI Safety best practices
适用场景与行动
场景:适合用来建立 AI 核心概念的共同语言。
适合谁:非技术创业者、AI 产品使用者、内容与业务负责人
下一步:先用一句话复述这个概念,再判断它和你的业务场景有什么关系。
这张卡片由杨思远基于真实工作流和实测经验整理。
如发现信息过时或有误,可通过 /contact 反馈。