FreeToken

55分钟前发布 1 0 0

FreeToken是一款开源边缘原生MoE推理引擎,支持在个人消费级GPU上运行290B+参数前沿模型。提供OpenAI/Anthropic兼容API,适合开发者本地部署AI Agent。

收录时间:
2026-08-31
其他站点:
FreeTokenFreeToken

FreeToken - 边缘原生MoE推理引擎,单卡运行290B+大模型与带宽自适应执行

FreeToken 简介

FreeToken是由UC Berkeley、MIT等机构联合开发的开源边缘原生MoE推理引擎。平台通过带宽自适应CPU-GPU协同执行、全层双缓冲预填充与语义感知缓存,将数据中心级推理能力带到个人消费级硬件。支持单卡运行DeepSeek-V4-Flash(284B)、GLM-5.2(753B)等前沿MoE模型,提供OpenAI与Anthropic兼容API,可无缝接入Claude Code、Codex等编码Agent。采用Apache-2.0许可,提供桌面应用与CLI双形态。

FreeToken 核心功能/服务

带宽自适应CPU-GPU协同执行:实时探测本机PCIe带宽与CPU算力,动态分流专家计算至GPU与CPU。RTX 5090上Qwen3.6-35B-A3B达77-83 tok/s,较现有边缘推理系统提升1.3-2.3倍
语义感知缓存与弹性内存:在特殊Token边界设置检查点,Agent上下文编辑时仅需增量预填充,避免重复计算。支持运行时动态调整VRAM分配,无需重启引擎。
前沿模型与生态兼容:支持20+ MoE模型,覆盖DeepSeek-V4-Flash、GLM-5.2、Qwen3.6等,支持MXFP4/NVFP4/FP8/BF16量化。提供OpenAI/Anthropic兼容API,一键配置Agent本地后端

FreeToken 适合谁

  • AI开发者与研究者:需要在本地运行前沿MoE模型进行实验与开发,利用带宽自适应执行在消费级硬件上获得数据中心级推理性能
  • 隐私敏感型团队:受监管数据无法上传云端,需要在本地部署Claude Code、Codex等Agent,利用FreeToken保障数据主权
  • 个人AI爱好者:希望在个人电脑或笔记本上体验大模型,从8GB RTX 4060到RTX 5090均可运行35B至284B参数模型

为什么选择FreeToken

FreeToken由Berkeley、MIT等顶尖机构联合开发,论文发表于arXiv。其边缘原生设计将GPU、CPU、系统内存与PCIe带宽视为统一推理平台,通过带宽自适应执行与语义感知缓存突破传统边缘推理的性能天花板。开源Apache-2.0许可,提供桌面应用与CLI,让个人设备成为前沿AI的实用平台。访问FreeToken官网,在个人硬件上运行数据中心级模型

数据统计

关于(FreeToken)特别声明

本站商娱网提供的FreeToken都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由商娱网实际控制,在2026-08-31 13:20收录和巡查时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,商娱网不承担任何责任。

相关导航

DeepSeek

DeepSeek

深度求索(DeepSeek),成立于2023年,专注于研究世界领先的通用人工智能底层模型与技术,挑战人工智能前沿性难题。基于自研训练框架、自建智算集群和万卡算力等资源,深度求索团队仅用半年时间便已发布并开源多个百亿级参数大模型,如DeepSeek-LLM通用大语言模型、DeepSeek-Coder代码大模型,并在2024年1月率先开源国内首个MoE大模型(DeepSeek-MoE),各大模型在公开评测榜单及真实样本外的泛化效果均有超越同级别模型的出色表现。和 DeepSeek AI 对话,轻松接入 API。

暂无评论

您必须登录才能参与评论!
立即登录
none
暂无评论...