模型与机制 · 02-12

对齐(Alignment)

杨思远 / 思行致远 · 2026/6/29 · 置信度:高
对齐AlignmentAI安全

让模型行为更符合人类意图、价值、安全边界和任务要求的训练与约束过程。

对齐(Alignment)

让模型行为更符合人类意图、价值、安全边界和任务要求的训练与约束过程。


一、是什么

  • 让模型行为更符合人类意图、价值、安全边界和任务要求的训练与约束过程。
  • 类比:像让能力很强的员工不仅会做事,还知道哪些事不能做。
  • 关键澄清:
它不是什么它是什么
不是简单屏蔽敏感词把能力、意图和安全边界拉到同一方向的系统工程

二、为什么重要

  • 对齐决定模型是否可控、可用、可信。
  • 不懂它会怎样:没有对齐,能力越强的模型越可能放大错误或风险。

三、日常怎么理解

  • 用一句话讲给非技术朋友听:对齐就是让 AI 按人真正想要的方向做事。
  • 常见场景:拒绝危险请求、遵守格式、减少有害输出、符合用户目标。

四、常见误解

误解真相
对齐会让模型变笨好的对齐是在能力和边界之间做平衡。

五、延伸阅读

适用场景与行动

场景:适合用来建立 AI 核心概念的共同语言。

适合谁:非技术创业者、AI 产品使用者、内容与业务负责人

下一步:先用一句话复述这个概念,再判断它和你的业务场景有什么关系。

这张卡片由杨思远基于真实工作流和实测经验整理。

如发现信息过时或有误,可通过 /contact 反馈。