中文
Agent infrastructure

krasis

brontoguana/krasis

A hybrid LLM inference runtime for running very large models on consumer GPUs with limited VRAM. Uses GPU prefill, decoding, and hot-cold expert management to enable local execution for individual practitioners.

Topics

  • cpu-inference
  • gguf-model-support
  • gpu-inference
  • hybrid-inference
  • inference-engine
  • inference-optimization
  • large-language-models
  • llm-inference