cd ~/open-source/

chrille@linux:~$ apt show llmkube

LLMKube

LLMKube är en Kubernetes-operator för egen LLM-inferens där du kör modeller med olika runtime-miljöer och får ett OpenAI-kompatibelt API som fungerar med befintliga klienter.

Projektsidan för LLMKube
Projektets egen sida, som den såg ut vid importen.

LLMKube gör det möjligt att köra stora språkmodeller i Kubernetes på egen hårdvara. Den stödjer flera runtime-miljöer som llama.cpp, vLLM, TGI och Ollama, och kan fördela modeller över flera GPU:er. Du får också ett OpenAI-kompatibelt API, så befintliga klienter fungerar utan ändringar. För team som redan kör Kubernetes och vill ha kontroll över inferens istället för att anropa externa API:er är det här en komplett lösning. Det kräver att du har hårdvaran, men då slipper du löpande kostnader per anrop. Du skalar upp och ner efter behov.