chrille@linux:~$ apt show llmkube
LLMKube
LLMKube är en Kubernetes-operator för egen LLM-inferens där du kör modeller med olika runtime-miljöer och får ett OpenAI-kompatibelt API som fungerar med befintliga klienter.
LLMKube gör det möjligt att köra stora språkmodeller i Kubernetes på egen hårdvara. Den stödjer flera runtime-miljöer som llama.cpp, vLLM, TGI och Ollama, och kan fördela modeller över flera GPU:er. Du får också ett OpenAI-kompatibelt API, så befintliga klienter fungerar utan ändringar. För team som redan kör Kubernetes och vill ha kontroll över inferens istället för att anropa externa API:er är det här en komplett lösning. Det kräver att du har hårdvaran, men då slipper du löpande kostnader per anrop. Du skalar upp och ner efter behov.
MER UR AI & LLM
