Inference setup for running large language models locally on microcontrollers, storing models in flash memory to demonstrate offline low-resource text generation demos.