Serves optimized large language models directly from users own GPUs and NPUs, letting developers run local AI apps privately through standard inference interfaces.