AB
AiBoss站
project

FreeToken - 开源端侧 MoE 大模型推理系统,支持满血运行

FreeToken 是 UC Berkeley 与 MIT 等机构联合开源的端侧 MoE 大模型推理系统。系统通过全层双缓冲、带宽自适应混合调度、Agent 状态复用及弹性显存热扩缩容等...

FreeToken是什么

FreeToken 是 UC Berkeley 与 MIT 等机构联合开源的端侧 MoE 大模型推理系统。系统通过全层双缓冲、带宽自适应混合调度、Agent 状态复用及弹性显存热扩缩容等技术,将个人电脑的 CPU、内存、PCIe 与 GPU 统一为弹性计算平台,实现单卡消费级硬件满血运行 Qwen3.6-35B、DeepSeek-V4-Flash 284B 等超大 MoE 模型,让本地部署顶尖 AI 成为现实。

FreeToken的主要功能

  • 端侧满血推理:支持在 RTX 4060/5090 等消费级单卡上满血运行 Qwen3.6-35B、DeepSeek-V4-Flash 284B 等超大 MoE 模型。
  • 全层双缓冲预取:GPU 计算当前层时,后台通过 PCIe 流式预取下一层 Expert 权重,彻底消除 I/O 等待气泡。
  • 带宽自适应调度:实时探测 PCIe 带宽与 CPU 算力,动态分流未命中 Expert 至 GPU 缓存或 CPU 就地计算,拉到硬件吞吐极限。
  • Agent 状态复用:在特殊 Token 边界设置轻量检查点,上下文编辑时仅从最近锚点增量 Prefill,避免重复计算完整历史。
  • 弹性显存热扩缩:后台应用抢占显存时,无缝收缩 GPU Cache 并转交 CPU 计算,实现 0 停机、不 OOM 的平滑降级。
  • 极速低延迟:首 Token 延迟降低 42–58%,Agent 多轮交互 TTFT 减少 65–80%,整体比 Ollama 快 2–4 倍。

FreeToken的技术原理

  • 全层双缓冲预取:在 Prompt 处理阶段,FreeToken 实现计算与数据搬运的完全重叠,当 GPU 正在计算第 l 层时,第 l+1 层的 Expert 权重已经通过 PCIe 后台预取流式传输,基本消除了 I/O 等待气泡,使得 Prefill 过程不会因为逐层从系统内存拉取 Expert 产生严重阻塞。
  • 带宽自适应混合调度:运行时系统实时探测本机的 PCIe 实际带宽与 CPU 瞬时算力,动态计算出最优分流比率,一部分 Expert 命中 GPU 的 LRU 缓存,未命中部分根据实时带宽智能分流,部分通过 PCIe 传输到 GPU,部分直接原地在 CPU 并行计算,将硬件吞吐拉到该拓扑下的理论极限。
  • 面向 Agent 的智能状态复用:针对 Coding Agent 或工具调用模型频繁微调上下文的场景,FreeToken 在特殊 Token 边界设置轻量级检查点,当上下文发生编辑时,系统仅需从最近的有效锚点恢复并增量 Prefill 新增后缀,无需重新计算整个上下文,大幅减少多轮工具调用与思维链迭代中的重复计算开销。
  • 弹性显存动态热扩缩容:针对个人电脑常有其他应用抢占显存的现实情况,FreeToken 支持在不重启 Serving 服务的前提下动态热调整 GPU 中 Expert Cache 的大小,当可用显存骤降时无缝收缩缓存并将更多未命中 Expert 转交 CPU 计算,保证推理服务平滑降级不触发 CUDA Out of Memory 崩溃。

微信关注回复“开源”,加入AI开源项目交流群

如何使用FreeToken

  • 桌面 App 安装:访问FreeToken官网 https://www.flashml.ai/ 下载 Windows 或 Linux 桌面 App,安装后通过 GUI 界面即可启动推理服务。
  • 命令行快速安装:通过命令行执行 uv pip install "freetoken[accel]" 一键完成 CLI 工具的安装。
  • 模型载入与自动调度:载入支持的 MoE 模型权重,系统会自动完成 CPU-GPU 异构调度与带宽自适应配置。
  • 硬件配置建议:运行 DeepSeek-V4-Flash 等超大模型时,建议配备 32GB 显存并搭配 192GB 以上内存保证稳定流畅。
  • 弹性显存自动管理:使用过程中若后台有游戏或渲染抢占显存,FreeToken 会自动热扩缩容,无需手动干预或重启服务。

FreeToken的核心优势

  • 打破硬件门槛:消费级单卡(如 RTX 4060/5090)即可满血运行 35B–753B 参数的超大 MoE 模型,无需数据中心集群。
  • 推理速度领先:比 Ollama 快 2–4 倍,比 llama.cpp 快 1.46 倍,笔记本 RTX 4060 跑 Qwen3.6-35B 可达 39.3 tok/s。
  • 首 Token 延迟极低:通过全层双缓冲与带宽自适应调度,将长 Prompt 的 TTFT 降低 42–58%。
  • Agent 交互优化:基于 Token 边界轻量检查点与状态复用,多轮工具调用场景的 TTFT 减少 65–80%。
  • 弹性显存不崩溃:后台应用抢占显存时,可热扩缩 GPU Cache 并转交 CPU 计算,实现 0 停机、不 OOM 的平滑降级。
  • 全栈异构协同:将 CPU、系统内存、PCIe 总线与 GPU 统一为弹性推理平台,自动收敛至硬件拓扑的理论最大吞吐。

FreeToken的项目地址

  • 项目官网:https://www.flashml.ai/
  • GitHub仓库:https://github.com/FlashML-org/FreeToken
  • arXiv技术论文:https://arxiv.org/pdf/2608.16157

FreeToken的同类竞品对比

对比维度 FreeToken Ollama
定位 端侧 MoE 专用全栈推理系统 通用本地大模型运行框架
MoE 模型支持 原生深度优化,支持 20+ 种 MoE 模型满血运行 部分 MoE 模型缺乏支持或无法启动(如 DSV4-Flash)
推理速度 比 Ollama 快 2–4 倍(RTX 4060 跑 Qwen3.6-35B 达 39.3 tok/s) 基线速度,PCIe 带宽瓶颈明显
首 Token 延迟 通过双缓冲预取降低 TTFT 42–58% 长 Prompt 下逐层拉取 Expert,延迟较高
Agent 多轮交互 状态复用使 TTFT 减少 65–80% 上下文修改后需重算,延迟累积
显存弹性 后台抢占显存时可热扩缩容,0 停机不 OOM 显存不足时直接触发 CUDA OOM 崩溃
硬件协同 CPU+内存+PCIe+GPU 统一弹性调度 主要依赖 GPU,CPU 卸载效率有限
安装方式 GUI App / CLI uv pip install "freetoken[accel]" ollama run 命令行一键拉取

FreeToken的应用场景

  • 本地 AI Coding Agent:在笔记本或游戏 PC 上本地运行 Claude Code、OpenClaw 等编程 Agent,支持多轮工具调用与思维链迭代,无需联网可实现智能代码补全与调试。
  • 端侧超大 MoE 模型推理:个人用户可在 RTX 4060/5090 等消费级单卡上满血运行 DeepSeek-V4-Flash(284B)、GLM-5.2(753B)等前沿模型,打破数据中心依赖。
  • 高并发多轮对话服务:客服、知识问答等需要频繁修改上下文的对话场景,利用 Token 边界检查点与状态复用,避免重复计算,显著降低多轮响应延迟。
  • 游戏/工作并行的弹性 AI 助手:在后台运行 3D 渲染、游戏或开发工具时,FreeToken 可自动收缩 GPU 缓存并转交 CPU 计算,保证 AI 推理服务不中断、不崩溃。
  • 边缘设备科研与原型验证:科研人员可在实验室普通工作站上快速部署和测试最新开源 MoE 模型,无需申请服务器资源,降低大模型研究门槛。