deltafin

在普通电脑上跑起 Kimi K3 这个 2.8 万亿参数的超大模型。不靠堆硬件,而是靠”按需加载”:每次推理只拉取当前 token 需要的专家模块,其余 1.45TB 的权重数据要么存本地磁盘,要么从 Hugging Face 边下边用

Github地址

https://github.com/gavamedia/deltafin

主要实现

  • 本地跑通完整版 Kimi K3(2.8T 参数,92 层,每层 896 个专家),不用阉割模型
  • 两种运行模式:1.7TB 全本地安装(推荐,速度稳定)或 215GB 轻量版(流式加载,首次调用慢)
  • 支持 Apple Silicon(MPS/Metal 加速)、NVIDIA CUDA、x86/ARM Linux 三平台
  • 内置 OpenAI 兼容 API,可直接对接 chat 客户端和编码助手
  • 推理结果可复现,greedy 解码相同 prompt 输出一致
  • 可选 int8 量化压缩主干网络,磁盘占用砍半,质量损失肉眼难辨

注意事项

  • 只是个技术验证,不是给日常聊天用的
  • M1 Max 上生成一个 token 要 14.6 秒
  • 长问题等半天
  • 硬盘要够大,内存越多越好