Optimized quantization and inference library for running large language models locally on consumer GPUs, supporting parallel execution, offloading, and open APIs.