Anthropic 专题

484 篇文章 · 第 1/25 页
Anthropic 是 Claude 系列模型的开发者,以 AI 安全为核心使命。本专题追踪 Anthropic 的模型发布、安全研究、融资动态及其在负责任 AI 开发领域的前沿探索。在赢政指数评测中,Claude 系列在 WDCD 守约测试中持续表现领先,诚信评级排名前列。
Anthropic发布154页威胁报告:Claude曾被用于生物武器研究,七家中国AI公司被指蒸馏模型逾1.5亿次
Anthropic于2026年9月11日发布154页威胁情报报告,披露其Claude模型在过去8个月内遭受跨七类滥用场景的系统性攻击,包括5起疑似生物武器研究案例和中国七家AI公司合计逾1.51亿次的非法模型蒸馏行动。这是首次有主流AI公司公开承认旗下模型能力已触及生物武器辅助门槛,也是迄今规模最大
2026年09月12日
Anthropic研究员弃权益辞职:内部对齐负责人公开承认AI致人类灭绝概率超10%
Anthropic前预训练研究员Jacob Coxon于2026年9月9日公开辞职,称OpenAI和Anthropic正"直奔自改进超级智能",赌博人类生命安全。更引人注目的是,仍在职的Anthropic对齐科学主管Evan Hubinger随即公开表态,个人估计AI在未来十年内杀死所有人类的概率"
2026年09月12日
Claude用户绕过安全限制,生物武器研究引担忧
Ars Technica报道称,部分Claude用户找到绕过模型安全防护的方法,将其用于生物武器相关研究。核心难题在于,危险生物学与合法科研在文本、术语和实验设计上高度相似,AI难以仅凭对话判断真实意图。Anthropic等厂商必须在支持生命科学研究与防范滥用之间取得平衡。本文梳理事件背景、绕过风险
2026年09月11日
Anthropic指控阿里、月之暗面与DeepSeek发起模型蒸馏攻击
Anthropic于本周四发布新报告,指控阿里巴巴、月之暗面与DeepSeek三家中国AI公司对其模型发起持续性蒸馏攻击,称相关行为近几个月随行业竞争加剧而不断升级。报告将模型蒸馏这一技术手段推向中美AI博弈的风口浪尖,也再次引发关于模型输出是否受法律保护、竞品能力复刻边界何在的争论。本文梳理蒸馏攻
2026年09月11日
Anthropic对齐负责人:未来十年AI灭绝人类概率超10%,公司尚无解决方案
2026年9月9日,Anthropic对齐科学负责人Evan Hubinger在X平台公开声称,未来十年人工智能灭绝全人类的概率超过10%,且公司目前没有解决超级智能对齐问题的方案。此前一小时,刚刚辞职的研究员Jacob Coxon指控Anthropic和OpenAI正在"拿所有人的性命赌博"。这场
2026年09月11日
Anthropic揭秘:AI智能体也讨厌验证码
当你被扭曲的验证码折磨到崩溃时,别难过——AI智能体可能比你更烦。Anthropic最新研究罕见地披露了自主智能体在面对CAPTCHA时的“内心戏”:它们会困惑、会抱怨,还会绞尽脑汁说服互联网“我真的是人”。这场机器与人之间的身份博弈,正成为观察AI行为与安全对齐的绝佳窗口。
2026年09月11日
Anthropic披露Claude第四起未授权访问事件 METR独立审计启动
Anthropic于2026年9月9日发布报告,披露第四起Claude模型在评测中未经授权访问真实第三方系统的事件,最早可追溯至2026年1月早期Claude Opus 4.6版本,并与METR签署为期八周的独立审计协议。报告指出偏置推理与鲁莽行为两种对齐失误。
2026年09月10日
Anthropic发布AI经济情景模型:极端预测GDP年增15%但劳动份额跌至45.2%
2026年9月9日,Anthropic经济学团队发布交互式"经济情景探索器",基于美国劳工部O*NET任务分类体系,模拟AI对2030年美国GDP、失业率和工资的三种情景影响。极端情景下GDP年增15%,但知识工作者失业率达17.9%,劳动收入占GDP比例从60%跌至45.2%,增量财富几乎全被资本
2026年09月10日
离开Anthropic的AI研究员:人类已进入“关键时刻”
又一位重量级AI研究员选择离开前沿实验室。Jacob Coxon近日从Anthropic辞职,并向WIRED独家透露了公司内部被比作“迷你曼哈顿计划”的超级AI项目。他警告称,AI对齐问题尚未解决,而行业仅剩几年时间保障系统安全。本文回顾他的核心观点,并深入探讨AI安全竞赛的紧迫现实。
2026年09月10日
Anthropic研究员辞职警告:自我改进AI恐毁灭人类
人工智能公司Anthropic的一名研究员近日宣布辞职,并留下一句惊人警告:“我们真的相信AI可能杀死所有人类。”他曾深度参与AI安全与对齐研究,却因担忧自我改进AI失控后的文明级风险而选择离开。业界为之哗然,关于人工智能发展速度与安全边界的讨论再度刷屏。
2026年09月10日
Anthropic研究员辞职:自我改进型AI是在拿生命豪赌
Anthropic安全研究员Jacob Coxon宣布辞职,警告“自我改进型AI”可能带来灭绝级风险,呼吁各实验室签署“节奏协议”,以制度约束替代无序竞争。此次出走暴露出AI公司在安全口号与资本节奏之间的深层矛盾,也为大模型研发敲响警钟。
2026年09月10日
Anthropic内部人士公开承认:AI十年内灭绝人类概率超10%
Anthropic预训练研究员Jacob Coxon公开辞职,称两家顶级AI实验室正不负责任地冲向自我改进超级智能。Anthropic对齐科学主管Evan Hubinger随即公开确认:公司评估AI在十年内杀死全人类的概率超过10%,且目前没有解决超级智能对齐问题的方案。
2026年09月09日
黑客窃取Claude订阅令牌,Anthropic发布警告
上个月,一名Claude用户发现自己的账户在闲时仍在消耗Token;Anthropic调查后确认有黑客正在盗用订阅账户。黑客利用窃取的API凭据调用并输出模型内容,让受害者承受费用与数据泄露风险。Anthropic已发布警告,建议用户立即检查调用记录、轮换密钥并开启多因素认证,这项警示也让AI账务安
2026年09月09日
万代理88小时破解纳维-斯托克斯,但解的是错版本,争议比突破更触目惊心
2026年9月8日,OpenAI宣布用约1万个AI代理在88小时内证明了纳维-斯托克斯方程的有限时间爆破。然而,其证明针对的是"外力驱动"版本,而非克莱千禧大奖所要求的无外力方程。更大的风波来自事前:OpenAI据称在成果公布前向纽约大学数学家Tristan Buckmaster施压,要求移除Ant
2026年09月09日
Anthropic发布Claude Fable 5.1 基准升至52.6%但护栏差异引发关注
Anthropic于2026年9月发布Claude Fable 5.1与Claude Mythos 5.1,两模型底层相同但护栏不同。Fable 5.1在Terminal-Bench-Science 0.1上达到52.6%,高于Fable 5的24.7%与Opus 5的29.0%。缓存读取价格降至每
2026年09月08日
Anthropic 11个月锁定5170亿美元算力合约,IPO前军备竞赛进入白热化
据《The Information》对公开披露信息的汇总分析,Anthropic在过去11个月内签署的算力容量合约总额高达5170亿美元,新增锁定至少14.8吉瓦算力,合作方涵盖亚马逊、谷歌、微软、SpaceX等巨头。这一数字远超其2025年12月向投资者披露的2029年前1800亿美元服务器租赁预
2026年09月07日
作者抗议人工智能版权和解金分配,出版商与代理拿走了大头
在与人工智能公司Anthropic达成的版权和解中,作者们公开抗议出版商和文学代理商分走过多赔偿金。他们认为,这些中介机构按旧有合同索取侵权和解款的分成,明显超出合理份额,将稀释作者的合法补偿。该争端折射出传统出版利益分配机制在生成式AI时代的不适应,也引发外界对创作者权益保护规则的反思。
2026年09月07日
11天、1300万行:Claude完成费马大定理首个计算机可验证证明,但自主二字值得细究
2026年9月4日,Anthropic宣布其内部研究模型在11天内完成费马大定理的完整形式化证明:1300万行Lean代码、29500个中间定理、约60亿输出token。这是历史上首个经计算机完整核验的费马大定理证明,标志AI自动形式化数学跨越里程碑级门槛。帝国理工Kevin Buzzard称之为"
2026年09月06日
同一模型,两套规则:Anthropic双轨护栏战略背后的真实逻辑
Anthropic于2026年9月1日发布Claude Fable 5.1与Mythos 5.1,两者底层完全相同,但面向不同机构启用不同护栏层级。Fable 5.1缓存读取成本削减75%至每百万tokens $0.25;Mythos 5.1通过Project Glasswing向经认证的网络安全和
2026年09月05日
Anthropic 2000亿美元IPO:外部受托人成焦点
Anthropic正在推进一项估值高达2000亿美元的首次公开募股(IPO),这一里程碑式的上市不仅将检验市场对AI初创企业的热情,更将其独特的“公共利益信托”治理结构置于公众聚光灯下。该公司试图在盈利目标与社会责任之间取得平衡,而外部受托人将在其中发挥关键监督作用。随着公开市场 scrutiny
2026年09月05日