原创 研究人员读取Anthropic等模型加密推理 安全机制漏洞暴露 研究人员开发出新方法,已成功读取Anthropic、OpenAI和Google模型的加密内部推理,并绕过反蒸馏保护。实验室在数月前收到通知。该事件揭示安全机制存在漏洞,并伴随凭证泄露风险。X平台和媒体对此表达担忧,安全倡导者呼吁提高透明度。 AI安全 模型对齐 推理机制 1天前 70
测评 GPT-5.5暴跌19.2分!6模型WDCD守约测试集体退步 本轮WDCD测试中6个模型全部下滑,无一上升,GPT-5.5跌19.2分最惨,Gemini与Qwen跌幅均超6分。Claude Opus 4.7仍以65分领跑,显示其在约束遵循上具备明显优势,值得持续追踪。 WDCD 守约测试 模型对齐 AI能力退化 2026年5月20日 687