原创 安全基准先于能力饱和:Anthropic风险报告揭示自证守约的结构性裂缝 Anthropic于2026年8月14日发布第二份全公司风险报告,将失调风险评级从"极低"上调至"低"。报告同时披露:用于检测危险能力阈值的内部基准已全面饱和,恰在此时公司观察到能力加速的早期迹象;内部代号Model 2的未发布模型在CoB Anthropic AI安全 模型对齐 风险报告 7小时前 53