Dependency-free, embeddable C inference engine for ultra-large mixture-of-experts models, streaming activated Kimi K3 weights from NVMe with paged caching to run beyond available RAM.