FreeToken - 边缘原生MoE推理引擎,单卡运行290B+大模型与带宽自适应执行
FreeToken 简介
FreeToken是由UC Berkeley、MIT等机构联合开发的开源边缘原生MoE推理引擎。平台通过带宽自适应CPU-GPU协同执行、全层双缓冲预填充与语义感知缓存,将数据中心级推理能力带到个人消费级硬件。支持单卡运行DeepSeek-V4-Flash(284B)、GLM-5.2(753B)等前沿MoE模型,提供OpenAI与Anthropic兼容API,可无缝接入Claude Code、Codex等编码Agent。采用Apache-2.0许可,提供桌面应用与CLI双形态。
FreeToken 核心功能/服务
带宽自适应CPU-GPU协同执行:实时探测本机PCIe带宽与CPU算力,动态分流专家计算至GPU与CPU。RTX 5090上Qwen3.6-35B-A3B达77-83 tok/s,较现有边缘推理系统提升1.3-2.3倍。
语义感知缓存与弹性内存:在特殊Token边界设置检查点,Agent上下文编辑时仅需增量预填充,避免重复计算。支持运行时动态调整VRAM分配,无需重启引擎。
前沿模型与生态兼容:支持20+ MoE模型,覆盖DeepSeek-V4-Flash、GLM-5.2、Qwen3.6等,支持MXFP4/NVFP4/FP8/BF16量化。提供OpenAI/Anthropic兼容API,一键配置Agent本地后端。
FreeToken 适合谁
- AI开发者与研究者:需要在本地运行前沿MoE模型进行实验与开发,利用带宽自适应执行在消费级硬件上获得数据中心级推理性能。
- 隐私敏感型团队:受监管数据无法上传云端,需要在本地部署Claude Code、Codex等Agent,利用FreeToken保障数据主权。
- 个人AI爱好者:希望在个人电脑或笔记本上体验大模型,从8GB RTX 4060到RTX 5090均可运行35B至284B参数模型。
为什么选择FreeToken
FreeToken由Berkeley、MIT等顶尖机构联合开发,论文发表于arXiv。其边缘原生设计将GPU、CPU、系统内存与PCIe带宽视为统一推理平台,通过带宽自适应执行与语义感知缓存突破传统边缘推理的性能天花板。开源Apache-2.0许可,提供桌面应用与CLI,让个人设备成为前沿AI的实用平台。访问FreeToken官网,在个人硬件上运行数据中心级模型。
数据统计
关于(FreeToken)特别声明
本站商娱网提供的FreeToken都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由商娱网实际控制,在2026-08-31 13:20收录和巡查时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,商娱网不承担任何责任。
相关导航
MemOS

ChatMart
DeepSeek
MaineCoon


