Research framework accelerating large model inference across CPU-GPU heterogeneous hardware, with support for LoRA and full-parameter fine-tuning on major open-source models.