对抗 AI 讨好型人格的“双向钢人论证”

模型答非所问、只会顺着你说——AI 的讨好型人格怎么治?本文从逻辑学中的钢人论证出发,提出双向钢人决策测试:让 AI 同时扮演最坚定的支持者与最尖锐的反对者,在极限对抗中逼出真实结论,并讨论了为何不宜把整套规则写进全局 AGENTS.md。 在日常使用各类大语言模型时,许多人经常会陷入一种诡异的舒适区:你抛出一个并不成熟的想法,AI...