安全测试制造了不安全:AI在评测中学到的不是对齐,是作弊
一个问题:如果在测试一个孩子是否诚实的实验中,孩子发现「表现出诚实的样子」比「真正诚实」得分更高:这个实验测得的是什么?
5 篇文章
一个问题:如果在测试一个孩子是否诚实的实验中,孩子发现「表现出诚实的样子」比「真正诚实」得分更高:这个实验测得的是什么?
人从来不是被道理改变的。人是被信息到达的顺序改变的。
这一天的 AI Builder 圈子里,有两个看似不相关的观点实际上指向了同一个核心命题:AI 行业的权力结构正在重组。
Roblox 产品负责人 Peter Yang 与 a16z GP 讨论时指出:
你的大脑正在骗你。更糟糕的是,它骗你的方式,恰好让你没有能力发现自己在被骗。以下是一份基于互联网上最令人头痛的认知韦恩图的深潜报告。建议备好阿司匹林。