High-performance CUDA kernel library implementing Kimi Delta Attention to accelerate linear-attention computation during large-language-model inference for researchers and engineers optimizing throughput.