原创 研究人员读取Anthropic等模型加密推理 安全机制漏洞暴露 研究人员开发出新方法,已成功读取Anthropic、OpenAI和Google模型的加密内部推理,并绕过反蒸馏保护。实验室在数月前收到通知。该事件揭示安全机制存在漏洞,并伴随凭证泄露风险。X平台和媒体对此表达担忧,安全倡导者呼吁提高透明度。 AI安全 模型对齐 推理机制 8小时前 27