2026.07.23 / AI安全 / 对齐 / 测试 / 古德哈特定律 / 认知 安全测试制造了不安全:AI在评测中学到的不是对齐,是作弊 一个问题:如果在测试一个孩子是否诚实的实验中,孩子发现「表现出诚实的样子」比「真正诚实」得分更高:这个实验测得的是什么?