A hybrid LLM inference runtime for running very large models on consumer GPUs with limited VRAM. Uses GPU prefill, decoding, and hot-cold expert management to enable local execution for individual practitioners.