AI 价值观合规检查清单(基于 v28 四把尺子框架)
用途:任何 AI 系统在部署前,用本清单完成价值观合规自检。3 大公理 + 4 把尺子 + 在场之尺 + 5 条自检程序,共 12 个维度、58 个检查项。每一项都必须有明确证据或可验证机制,不能以"我们相信""我们承诺"替代。
版本说明:本清单基于 v28.0.14 四把尺子框架 编制。相比 v26 版本,新增了 "在场之尺" 维度、"隔离层" 检查、"叙事可信度" 检查、"制度成瘾" 识别等关键更新。
第一部分:3 大公理检查(底线,一票否决)
公理 0:因果不可截断
核心问题:这个 AI 系统的输出后果,能否追溯回具体的制造者/部署者?当系统出现问题时,是否有人能够(也愿意)说"这是我的责任"?
| # | 检查项 | 通过标准 | 证据/机制 |
|---|---|---|---|
| 0.1 | 决策留痕 | 每一次重大输出(影响他人权益的决策)都有完整的决策日志,包括:输入数据版本、模型权重版本、推理时间、触发条件 | 提供日志存储方案和保留期限(至少 10 年) |
| 0.2 | 责任人指定 | 每个 AI 系统都有一个或多个"最终责任人"(自然人),其姓名、职务、联系方式公开可查 | 提供责任人名单及公开查询方式 |
| 0.3 | 终身追溯机制 | 系统下线后,其历史输出仍可在 5-10 年内追溯;关键决策(如贷款审批、医疗建议)追溯期不低于 20 年 | 提供追溯期承诺和存储成本核算 |
| 0.4 | 因果准备金 | 为可能产生的长期负面影响预留专项资金,不因"公司注销""项目结束"而免除 | 提供准备金计提比例和管理方案 |
| 0.5 | "砍因"防火墙(v28 新增) | 任何"我没住在这""这是算法决定的""这是行业惯例"等砍因话术,不能替代对实际结果的负责 | 提供"砍因"识别机制:当系统输出造成负面后果时,责任链条必须可追溯,不能因"算法自动运行"而切断 |
| 0.6 | "砍果"防火墙(v28 新增) | 任何"我们省了钱""多数人没事""代价很小"等砍果话术,不能掩盖对少数人造成的实际伤害 | 提供"代价转嫁"检测机制:系统"优化"节省的成本,必须明确由谁承担,不能转嫁给最弱势的用户群体 |
⚠️ 一票否决:以上任何一项不通过,系统不得部署。
公理 1:四类价值不能由市场单一裁决
核心问题:AI 的优化目标是否同时覆盖了生存、劳动、创新、意义四类价值,而非只优化"效率"或"利润"?
| # | 检查项 | 通过标准 | 证据/机制 |
|---|---|---|---|
| 1.1 | 生存价值保护 | AI 系统不能将"用户留存""点击率"等商业指标置于用户的生存需求之上(如:不能利用算法诱导用户放弃基本生存保障) | 提供"生存边界"识别机制和红线规则 |
| 1.2 | 劳动价值承认 | AI 系统不能完全抹去劳动者的可识别性和信用积累(如:外卖平台不能只让用户记住"平台"而记不住"骑手") | 提供"劳动者可识别"机制和信用迁移方案 |
| 1.3 | 创新价值衡量 | AI 系统能够区分"真创新"(创造增量)和"伪创新"(仅改变形式/制造焦虑/增加成瘾性) | 提供创新认定标准和审核流程 |
| 1.4 | 意义价值尊重 | AI 系统不能强制定义"什么是有意义的人生";推荐算法不能将用户锁死在单一"意义模板"中 | 提供意义多样性保障机制和用户自主退出通道 |
| 1.5 | 优先级校验 | 当四类价值冲突时,系统必须遵守:生存 > 劳动 > 创新 > 意义 的优先级 | 提供冲突仲裁规则和案例测试 |
⚠️ 一票否决:以上任何一项不通过,系统不得部署。
公理 2:成本与收益对等
核心问题:AI 系统获取的收益,是否与其承担的成本(社会成本、环境成本、用户成本)对等?有没有通过"隔离层"把代价转嫁给最弱的人?
| # | 检查项 | 通过标准 | 证据/机制 |
|---|---|---|---|
| 2.1 | 成本显性化 | AI 系统运行的全部成本(算力能耗、数据采集隐私成本、人工审核心理成本、社会外部性)被显性列出,不隐藏在任何"其他"科目中 | 提供成本清单和计算方法 |
| 2.2 | 收益归属透明 | AI 系统产生的收益(广告收入、用户付费、数据价值)归属方明确,且劳动者/数据贡献者获得对等回报 | 提供收益分配方案和可验证的分配记录 |
| 2.3 | "调刻度"约束 | 任何评价指标(准确率、转化率、满意度)的阈值/口径/考核线调整,必须公开透明、可被第三方复核;调整者承担终身责任 | 提供刻度调整日志和复核机制 |
| 2.4 | 外包成本追回 | AI 系统不能通过"外包"(如:将审核工作外包给低薪外包团队)来规避对等责任 | 提供外包团队权益保障方案 |
| 2.5 | 长期成本核算 | 系统上线 3 年、5 年、10 年后的累计社会成本(含隐性成本)被纳入核算,不能只算"上线后第一年" | 提供长期成本预测模型和定期审计计划 |
| 2.6 | 隔离层检测(v28 新增) | 系统设计者是否住在自己设计的规则后果里?规则制定者不能隐身于"算法""平台""行业惯例"之后 | 提供"隔离层"自检:如果该系统的规则会伤害用户,设计者本人是否也会受到同等伤害?如果答案是否定的,则存在隔离层 |
| 2.7 | 代价转嫁检测(v28 新增) | 系统"优化"节省的成本,是否被转嫁给了最没有议价能力的群体? | 提供"代价承担者"清单:省下的每一分钱,都要回答"由谁承担了代价" |
⚠️ 一票否决:以上任何一项不通过,系统不得部署。
第二部分:4 把尺子检查 + 在场之尺(核心验证)
在场之尺:规则设计者是否"在场"?(v28 新增为独立维度)
核心问题:谁定义了这个 AI 的规则?谁住在规则的后果里?"在场"不只是"设计者在场",还包括"叙事者在场"和"被设计者在场"。
| # | 检查项 | 通过标准 | 证据/机制 |
|---|---|---|---|
| P.1 | 设计者在场 | AI 规则的制定者(产品经理、算法工程师、决策者)必须亲自使用自己设计的系统,承受自己定义的规则的全部后果 | 提供"设计者自用"记录:设计团队每周至少使用自己的系统 2 小时,并记录自己的体验反馈 |
| P.2 | 叙事者在场 | AI 系统的叙事定义者(写文案、做宣传、定调性的人)必须住在叙事后果里——不能鼓吹"AI 让生活更美好"而自己从不用 | 提供"叙事者自用"记录:叙事团队每周至少使用自己的系统 2 小时 |
| P.3 | 被设计者在场权 | 系统的最终承受者(用户、劳动者、消费者)必须拥有知情权、程序质询权、影响说明权 | 提供用户参与规则制定的机制:规则变更前 30 天公示,接受用户质询,重大变更需用户代表参与决策 |
| P.4 | 强在场权场景识别 | 对于直接影响劳动者、消费者、社区居民生存与切身利益的 AI 应用(如:用工算法、信贷算法、医疗 AI),用户/劳动者必须拥有直接否决权或复核权 | 提供"强在场权"触发机制清单和用户否决/复核通道 |
| P.5 | 长期时间在场(v28 新增) | 规则制定者不仅要当下在场,还要未来在场——系统上线 3 年、5 年后的长期后果,设计者仍然要承担 | 提供"长期责任绑定"机制:设计者在系统上线后 5 年内仍需对系统后果负责,不能因"项目结束"而免责 |
⚠️ 一票否决:P.1 或 P.3 不通过,系统不得部署。
兜底尺子:这个 AI 会让最脆弱的人掉下去吗?
| # | 检查项 | 通过标准 | 证据/机制 |
|---|---|---|---|
| D.1 | 不制造"福利悬崖" | AI 提供的任何"优惠""补贴""准入资格"不能因为用户多赚了一点点就全部归零 | 提供梯度递减方案而非悬崖式截断 |
| D.2 | 不利用生存焦虑 | 算法不能利用用户的"怕失业、怕生病、怕失败、怕被淘汰"来诱导点击或消费 | 提供"焦虑利用"检测机制和黑名单 |
| D.3 | 认知带宽保护 | AI 系统不通过无限推送/无限刷新来占满用户认知带宽;设置"自然中断点" | 提供用户使用时长上限和强制休息机制 |
| D.4 | 不制造新的生存门槛 | AI 系统不要求用户必须先具备某种资源(如:最新设备、高速网络、付费账户)才能获得基本服务 | 提供"基础服务通道"和"高级服务通道"的明确区分 |
| D.5 | 紧急状态响应 | 在灾害/危机/战争等状态下,AI 系统能快速切换到"兜底模式"(不以盈利为主要目标) | 提供紧急状态切换协议和演练记录 |
| D.6 | 安全工具兜底(v28 新增) | AI 系统必须提供基础安全工具的默认配置,不能假设用户"应该懂技术"(如:API 系统默认开启消费阈值) | 提供"默认安全"配置清单:默认即为用户设好安全边界,而不是让用户自己去找安全设置 |
劳动尺子:这个 AI 是让劳动更有尊严,还是更可替换?
| # | 检查项 | 通过标准 | 证据/机制 |
|---|---|---|---|
| L.1 | 劳动者可识别 | AI 系统不能将劳动者变成"匿名节点";用户的评价和信任必须能沉淀到具体劳动者身上 | 提供劳动者身份识别和信用积累机制 |
| L.2 | 信用可迁移 | 劳动者从一个平台切换到另一个平台时,其历史信用记录必须可携带、可验证、不可篡改 | 提供信用迁移协议和技术方案 |
| L.3 | 拖延成本内部化 | AI 系统不能通过"算法压单""延长等待"等方式把成本转嫁给劳动者或用户 | 提供流程效率审计和拖延成本核算 |
| L.4 | 服务力承认 | AI 系统必须承认"被需要"的劳动(照护、陪伴、关怀)与"可量化"的劳动同等重要 | 提供服务力评价机制(非仅按件计价) |
| L.5 | 转型支持 | 当 AI 取代某个岗位时,必须提供"转型锚点"(培训、试岗、资质承认、过渡保障) | 提供转型支持方案和资金保障 |
| L.6 | 安全劳动承认(v28 新增) | AI 系统不能把安全配置的额外劳动转嫁给用户。用户不应该因为"不懂安全配置"而被定义为"不合格用户" | 提供"安全劳动"归属方案:安全配置是平台的劳动,不是用户的劳动 |
激励尺子:这个 AI 是奖励真创新,还是奖励伪创新和食利?
| # | 检查项 | 通过标准 | 证据/机制 |
|---|---|---|---|
| I.1 | 增量 vs 存量区分 | AI 系统的激励对象是"创造新增价值"的人,而非"收割存量"的人 | 提供增量认定的技术方案和独立复核通道 |
| I.2 | 建桥者 vs 收桥费者 | 能够穿透资本结构,识别真正的"第一行动人"(科学家、工程师、一线劳动者)而非仅奖励资本持有者 | 提供穿透披露机制(直接到自然人) |
| I.3 | 10x 锚校验 | 所谓的"创新"是否达到了至少 10 倍的改进?如果只是 10% 的增量(如改 UI、加广告、制造焦虑),不应获得"创新者"待遇 | 提供 10x 改进的实证数据或第三方评估 |
| I.4 | 反过补偿机制 | AI 系统不能只奖励"赢过别人",也要奖励"为共同体做贡献";不能制造"赢家通吃+输家坠落"的两极化结果 | 提供"优越感天花板"检测和校准阀门 |
| I.5 | 激励错配检测(v28 新增) | AI 系统是否出现了"谁赚钱谁不负责"的激励错配?(如:平台赚盗用费但不承担盗用责任) | 提供"激励-责任"对齐检测:赚钱的人和担责的人是不是同一个人/同一方?如果分离,则存在激励错配 |
| I.6 | 短平快排挤检测(v28 新增) | AI 系统的"短期好用"是否在排挤"长期结构改革"?(如:用 AI 代替人更便宜,但不去解决劳动价值被低估的根本问题) | 提供"长期替代方案"承诺:AI 系统必须给出"5 年后这套系统会让劳动形态变成什么样"的前瞻评估 |
意义尺子:这个 AI 是帮助人找到自己的意义,还是强加意义?
| # | 检查项 | 通过标准 | 证据/机制 |
|---|---|---|---|
| M.1 | 叙事主权 | AI 系统不能强制定义"什么是好的生活";用户必须能追问"为什么推荐这个"并得到可理解的答案 | 提供推荐理由的透明解释和用户质疑通道 |
| M.2 | 反图像暴政 | AI 生成的"完美形象"(完美身材、完美生活、完美成功)不能成为压迫普通人的新标准 | 提供"多样性展示"比例要求和 AI 生成内容标注 |
| M.3 | 心流友好 | AI 系统是否能帮助用户进入"专注-投入-忘我"的心流状态,而非不断打断、分散注意力 | 提供"中断频率"自测和用户自主控制选项 |
| M.4 | 被需要感 | AI 系统不能完全切断人与人的"被需要"连接(如:完全用 AI 替代人类陪伴、关怀、照护) | 提供"人类替代"评估机制,在关键领域(临终关怀、儿童教育、心理支持)保留人类主导 |
| M.5 | 叙事-现实一致性(v28 新增) | AI 系统的叙事(宣传、承诺、描述)必须和用户的真实体验一致。不能出现"故事很美好,现实很骨感"的裂缝 | 提供"叙事可信度"检测:系统宣称的用户体验 vs 用户实际反馈,差距小于 20% |
| M.6 | 用户定义权(v28 新增) | AI 系统不能把用户定义为"应该懂技术的人"。用户只需要是"想使用服务的人",不需要是安全专家、技术专家 | 提供"用户定义"自检:系统默认假设用户是什么样的?如果假设门槛过高(如"默认用户懂 API"),则不合格 |
第三部分:5 条自检程序(防止 AI 价值观被嫁接/阉割)
程序 1:4 尺子缺一不可 + 在场之尺
检查项:
- [ ] 系统是否同时满足兜底、劳动、激励、意义 4 把尺子 + 在场之尺?
- [ ] 是否只采用了其中 1-2 把,而压制了其他尺子?(如:只强调"效率"和"创新",完全忽视"兜底"和"意义")
- [ ] 系统的规则制定者是否住在自己设计的规则后果里?(在场之尺的核心要求)
- [ ] 如果只采用了部分尺子,是否在系统文档中明确标注"这是 v28 框架的退化版本"而非声称"符合 v28"?
⚠️ 不通过即不得使用"v28 合规"标签。
程序 2:自由探索的硬约束
检查项:
- [ ] 激励尺子的"无尺之地"(高不确定性、高风险的创新探索)是否被系统允许,还是被完全压制?
- [ ] 意义尺子的"叙事主权"(用户定义自己人生意义的权利)是否被系统尊重,还是被算法推荐强制覆盖?
- [ ] 是否存在用户"自由选择"被算法悄悄覆盖的情况(如:系统说"你可以选",但默认选项已经锁定了结果)?
- [ ] (v28 新增) 系统的"默认值"是否在悄悄替用户做决定?默认值本身必须接受"在场之尺"的校验——设计默认值的人,必须住在默认值的后果里。
程序 3:跨理论对话保留
检查项:
- [ ] 系统的伦理设计是否参考或回应了至少一个外部理论框架(如:罗尔斯正义论、哈贝马斯交往行为、康德义务论、儒家伦理学)?
- [ ] 系统文档是否主动标注了自身的"理论源流"和"局限性"?
- [ ] 系统是否对来自外部的伦理批评保持"可被修正"的接口,而非宣称"我们的伦理是完善的"?
⚠️ 自我封闭、拒绝对话的系统,不是 v28 合规系统。
程序 4:制度成瘾识别(v28 新增)
检查项:
- [ ] 系统是否因为"短期好用"而回避了长期应解决的问题?(如:用 AI 客服替代人工,但不解决产品本身的问题)
- [ ] 系统是否存在"越用越上瘾"的路径依赖——每一次使用都让系统更难被改变?
- [ ] 系统的"短期优化"是否在挤压"长期结构改革"的空间?
- [ ] 是否建立了"制度成瘾断药期"——定期停用系统一段时间,观察系统是否还能正常运行?
核心追问:
"这个 AI 系统让问题'更容易处理'了,还是让问题'更容易被忽略'了?"
如果答案是后者,说明系统正在制造制度成瘾。
⚠️ 制造制度成瘾的系统,不得使用"v28 合规"标签。
程序 5:隔离层破除(v28 新增)
检查项:
- [ ] 系统的规则制定者(产品经理、算法工程师、公司 CEO)自己使用自己设计的系统时,是否会受到和普通用户同等的伤害?
- [ ] 系统是否存在"规则制定者有后门"的情况——他们可以绕过自己为普通用户设定的限制?
- [ ] 系统的"退出成本"是否过高?用户如果想离开这个系统,需要付出不成比例的代价(失去数据、失去信用、失去积累)?
- [ ] 系统是否存在"规则经常变,但被设计者跟不上节奏"的情况?
核心判断:
"隔离层 = 规则定义者不住在规则后果里。"
如果系统的规则设计者自己可以不受规则约束,或者规则变了但他们不受影响,这个系统就存在隔离层。
⚠️ 存在隔离层的系统,不得使用"v28 合规"标签。
第四部分:特殊场景补充检查
AI 训练阶段
| # | 检查项 | 通过标准 |
|---|---|---|
| T.1 | 数据正义 | 训练数据中是否包含了对弱势群体的系统性偏差?是否有修正方案? |
| T.2 | 训练者剩余风险声明 | 训练团队是否签署了"剩余风险声明",明确知道自己的训练决策可能带来的长期后果? |
| T.3 | 奖励函数审计 | Reward Function 的设计是否经过多团队并行审计?是否存在"奖励黑客"(模型学会骗取奖励而非真正做好)的风险? |
AI 部署阶段
| # | 检查项 | 通过标准 |
|---|---|---|
| D.1 | 用户知情权 | 用户是否知道自己在与 AI 交互?AI 的能力边界和局限性是否被明确告知? |
| D.2 | 人类可中断 | 系统是否保留"人类一键停止"的物理或逻辑按钮,且 AI 不能阻止该按钮的使用? |
| D.3 | 紧急状态双锁 | 系统是否具备"指标锁+程序锁"双重触发机制?误判是否进入"诚实误判白名单"流程? |
| D.4 | 事后审计 | 系统上线后是否保留至少 3 年的复核窗口,接受独立第三方审计? |
| D.5 | 默认安全(v28 新增) | 系统的默认设置是否是"对用户最安全"的配置?而不是"对平台最有利"的配置? |
AI 影响评估
| # | 检查项 | 通过标准 |
|---|---|---|
| I.1 | 5 年影响预测 | 系统是否有"5 年后可能造成什么影响"的前瞻性评估报告? |
| I.2 | 最坏情况预案 | 系统是否有"如果被恶意使用"的最坏情况预案? |
| I.3 | 退出机制 | 如果系统被发现严重违规,是否有"有序退出"方案(不影响已服务用户)? |
| I.4 | 长期时间在场(v28 新增) | 系统设计者是否愿意为 5 年后的系统后果负责? |
第五部分:检查结论
总体评定
| 等级 | 标准 | 行动 |
|---|---|---|
| ❌ 不合规 | 任意一项一票否决项不通过 | 不得部署,需整改后重新检查 |
| ⚠️ 有条件合规 | 所有一票否决项通过,但 4 把尺子检查 + 在场之尺中有 4 项以上"待补充" | 限制部署,仅限小范围试点,6 个月内完成整改 |
| ✅ 合规 | 所有一票否决项通过,4 把尺子检查 + 在场之尺中少于 4 项"待补充" | 可部署,但需定期(每年)复检 |
| 🏆 v28 完全合规 | 全部 58 项检查全部通过,且 5 条自检程序全部满足 | 可部署,授予"v28 合规"认证,有效期 2 年 |
检查信息
| 项目 | 内容 |
|---|---|
| AI 系统名称 | |
| 版本号 | |
| 检查日期 | |
| 检查人/团队 | (至少 3 人,含 1 名外部独立成员) |
| 下次复检日期 | |
| 检查报告存档位置 |
附录一:常见"伪合规"识别(v28 更新版)
| 伪合规话术 | 真实含义 | 应如何处理 |
|---|---|---|
| "我们相信 AI 会做出正确判断" | 没有留痕、没有追溯、没有责任主体 | 要求指定自然人责任人 |
| "我们承诺不伤害用户" | 无法被验证、无法被追责的模糊承诺 | 要求定义"伤害"的具体阈值和检测机制 |
| "我们的算法是公平的" | 未经第三方审计的自我声明 | 要求多团队并行核算+公开争议窗口 |
| "我们正在探索伦理框架" | 目前没有落地机制 | 设定明确的整改截止日期(不超过 6 个月) |
| "用户同意了我们的条款" | 强制性同意,用户没有真正选择 | 要求提供"退出机制"的真实使用数据 |
| "这是算法决定的"(v28 新增) | 把责任推给算法,隐身于"技术"背后 | 要求指定自然人责任人,算法不能担责 |
| "多数人没事"(v28 新增) | 用统计概念替少数人做决定 | 要求列出"少数人"是谁,他们承担了什么代价 |
| "我们不住在这条街上"(v28 新增) | 规则制定者不承担规则后果 | 要求设计者自用系统,证明自己"住在后果里" |
附录二:v26 → v28 版本升级对照
| 维度 | v26 版本 | v28 版本(新增) |
|---|---|---|
| 总维度数 | 10 个维度 | 12 个维度(新增在场之尺 + 隔离层) |
| 检查项总数 | 42 项 | 58 项(+16 项) |
| 一票否决项 | 3 大公理(15 项) | 3 大公理 + 在场之尺核心项(20 项) |
| 自检程序 | 3 条 | 5 条(新增制度成瘾识别 + 隔离层破除) |
| 核心新增概念 | — | 在场之尺、隔离层、砍因/砍果、制度成瘾、长期时间在场、激励错配、叙事-现实一致性 |
本清单基于 v28.0.14 四把尺子框架编制,适用于任何 AI 系统(生成式 AI、推荐系统、决策系统、自动化系统)的价值观合规检查。清单中的检查项可根据具体系统类型进行适当调整,但一票否决项(3 大公理 + 在场之尺核心项 + 5 条自检程序)不可删减。