中文
Agent infrastructure

kimi-k3-in-c

fareedkhan-dev/kimi-k3-in-c

Inference engine written in portable C99 runs trillion-parameter Kimi K3 models on a single CPU with about 8GB RAM, using disk streaming and no BLAS, framework, or GPU dependencies.

Topics

  • avx2
  • c99
  • cpu-inference
  • deep-learning
  • from-scratch
  • inference-engine
  • kimi-k3
  • linear-attention