单张工作站GPU跑通753B参数模型:FreeToken打破本地推理的参数上限
加州大学伯克利分校与得克萨斯大学奥斯汀分校团队于2026年8月17日发布FreeToken,这套边缘原生MoE推理引擎通过带宽自适应调度,将本地可运行的参数上限从数十亿推至7530亿:8GB笔记本GPU运行35B模型、游戏台式机运行284B
加州大学伯克利分校与得克萨斯大学奥斯汀分校团队于2026年8月17日发布FreeToken,这套边缘原生MoE推理引擎通过带宽自适应调度,将本地可运行的参数上限从数十亿推至7530亿:8GB笔记本GPU运行35B模型、游戏台式机运行284B
Meta推出Llama 3.2系列1B/3B参数模型,支持边缘设备高效运行,具备强大视觉理解能力。开源社区反响热烈,下载量激增超20万互动。该模型低成本部署潜力巨大,推动手机与物联网AI应用,挑战云端AI垄断格局。
Meta推出Llama 3.2系列1B/3B参数模型,支持边缘设备运行,具备强大视觉理解能力。开源社区反响热烈,下载量飙升,X平台互动帖超20万。该模型低成本部署潜力巨大,有望推动手机和物联网AI应用,挑战云端AI垄断格局。
Meta推出Llama 3.2系列视觉模型,包括11B和90B参数版本,支持图像理解和设备端运行。发布后下载量迅猛增长,开发者社区互动超20万次,标志开源多模态AI挑战闭源巨头,推动边缘计算应用落地。