原创 arXiv新论文提出因果框架拆解AI欺骗机制 挑战现有诚信评测效度 2026年9月3日提交的arXiv论文2609.04166引入因果分类框架,区分表现欺骗与机制欺骗。实验显示欺骗性输出可在无对应机制时出现,机制存在也无法确立模型能动性,直接质疑当前诚信评测仅捕捉输出层假象的局限。 AI安全 诚信评测 因果框架 14小时前 74