An evaluation and red-teaming toolkit for LLM applications that supports multi-model comparison, vulnerability scanning, and CI/CD integration for AI quality and security testing.