OpenAI前研究员Diogo Almeida携4000万美元推出Jev无幻觉决策模型
2026年9月15日,Diogo Almeida创立的TypeSafe AI发布Jev模型并宣布4000万美元融资。该模型采用RLCD算法,输出结构化类型值,响应时间70-500ms,无法产生幻觉,专攻分类打分路由等决策任务,与现有LLM形
2026年9月15日,Diogo Almeida创立的TypeSafe AI发布Jev模型并宣布4000万美元融资。该模型采用RLCD算法,输出结构化类型值,响应时间70-500ms,无法产生幻觉,专攻分类打分路由等决策任务,与现有LLM形
Cognition于2026年9月10日发布SWE-2编程模型,基于月之暗面Kimi K3 2.8万亿参数基座,在FrontierCode 1.1 Main基准达到50.0%,与Fable 5.1差距不足1个百分点,同时运行成本降低64%。
2026年9月9日,DeepSeek上线deepseek-v4.1-flash-expires-on-0910限时内测。该模型采用全新架构,原生支持多模态,通过现有API访问,定价与V4 Flash系列一致,单账号并发上限20请求,计划于9
北京时间9月3日,谷歌发布Gemini 3.8 Flash及Gemini 3.8 Flash Cyber两款新模型。前者在DeepSWE v1.1长周期软件工程测试中得分73.7%,以远低于Claude Opus 5的价格实现接近的编程性能
2026年8月20日前后,Ox Alpha模型以stealth/ox-alpha身份出现在OpenRouter,支持1M token上下文及文本图像视频多模态输入,早期测试在编码和代理任务上超越GPT-5.6 Sol与Fable 5,目前免
2026年7月9日,OpenAI正式全球发布GPT-5.6三款模型Sol、Terra、Luna,旗舰版Sol在编程、网络安全等基准测试中刷新纪录,售价仅为Anthropic Fable 5的四分之一。然而独立评估机构METR记录到该模型有史
Meta推出Muse Glimmer 30B参数多模态模型,采用Apache 2.0许可开放权重。该模型经Muse Spark蒸馏优化,专为本地代理工作流设计,可在单张消费级GPU或Mac上运行,上下文长度达131072 token以上。训
Google于2026年8月13日推出Gemini 3.7 Flash模型,针对编码和代理任务,定价较Gemini 3.6 Flash减半,输入每百万token 0.75美元、输出3.75美元,至年底结束。该模型在FrontierCode
DeepSeek于2026年8月12日发布V4 Pro正式版,已在OpenRouter等平台可用,代理基准测试表现突出。X平台基准结果快速传播,开发者对性能接近或超越Qwen的说法反应积极,但长期稳定性和企业部署案例仍需观察。该事件加剧开源
阿里巴巴于2026年8月7日推出Qwen3.8-Max旗舰模型,重点强化代理任务与计算机使用能力,在代理任务基准测试中声称超越GPT-5.6。该消息获多家独立媒体证实,引发中国AI实验室竞争讨论,但具体超越细节尚未完全公开。
阿里巴巴于2026年8月发布Qwen3.8-Max模型,参数规模达2.4万亿,支持百万token上下文窗口。该模型已通过API立即可用,计划在8月10日所在周开放权重。基准测试显示其在编码和自主任务上接近Anthropic Fable 5等
OpenAI于2026年8月前后公布,其下一代主力模型家族Astra的内部版本在数学、量子复杂性和理论计算机科学领域解决了10个开放问题,问题积压至少十年,全部解决方案的token成本约2000美元。该模型支持多智能体协同处理长时间任务,已
Thinking Machines发布Inkling模型评估报告,提出既非完全开源权重也非完全封闭的中间路线,建议分阶段测试与访问以平衡安全与创新。此举为前沿模型发布提供新范式,引发行业讨论。文章基于已确认事实分析其战略定位、产业影响及开发
DeepSeek于2026年7月31日发布V4-Flash正式版API公测,支持Responses API格式并适配Codex,模型架构与预览版一致,仅重新后训练。V4-Pro正式版即将发布。该模型已集成至OpenCode Go等工具,用户
2026年8月1日前后,OpenAI通过Astra模型演示证明非索菲克群存在等重大数学与计算机科学难题。X平台上支持者视其为研究突破,反对者质疑真实性、成本及对人类研究的影响。该事件已获多家独立媒体报道,成为过去24小时AI领域热点。
Sarvam AI于2026年7月30日在Epoch会议上宣布,将在六个月内推出1万亿参数模型,同时升级视觉与语音平台。该公司现有105B参数模型已服务企业与政府,语音产品月处理50万小时音频,视觉平台已数字化3500万页文档,平台日均处理
Thinking Machines今日发布Inkling-Small,这是一款总参数2760亿、每token激活120亿的MoE模型。其性能与更大规模的Inkling相当,但体积和速度显著优化。全权重已开放于Hugging Face与Tin
7月27日月之暗面发布Kimi K3 2.8万亿参数MoE模型完整权重与技术报告,同时开放MoonEP、FlashKDA、AgentEnv三项基础设施。模型支持原生视觉与100万token上下文,开发者可免费下载部署。此举在中美AI开放与封
Moonshot AI于2026年7月16日发布Kimi K3模型,参数达2.8万亿,上下文窗口100万token,支持原生视觉理解。该模型计划7月27日开放权重,引发中美AI竞赛讨论。支持者认为中国开源策略加速创新,反对者担忧安全与地缘政
2026年7月19日阿里巴巴在WAIC期间预览Qwen3.8-Max-Preview,该2.4万亿参数多模态模型通过Token Plan订阅提供预览访问,定价为标准价的10%,计划近期开放权重。此举紧随Moonshot AI两天前发布Kim