Ein On-Premise-LLM im Unternehmen läuft auf eigener Hardware statt in der Cloud eines Anbieters. Für Betriebe, die mit Konstruktionsdaten, Kundendaten oder Verträgen arbeiten, ist das oft der einzig akzeptable Weg, ein Sprachmodell produktiv einzusetzen. Die Technik ist dabei selten das Problem. Es geht darum, ob sich der Betrieb rechnet.
Ein On-Premise-LLM lohnt sich bei hohem Anfragevolumen, dort amortisiert er sich oft in drei bis sechs Monaten gegenüber einer Cloud-API. Bei wenigen hundert Anfragen im Monat bleibt die Cloud günstiger. Die Hardware macht über fünf Jahre nur rund 35 Prozent der Gesamtkosten aus, der Rest sind Strom, Kühlung und Personal.
Was ein On-Premise-LLM an Hardware kostet
| Modell | Speicher | Preis | Geeignet für |
|---|---|---|---|
| NVIDIA H200 | 141 GB | 34.000 bis 42.000 Euro | große Modelle, hohes Volumen |
| NVIDIA H100 | 80 GB | 26.000 bis 32.000 Euro | produktiver Regelbetrieb |
| NVIDIA L40S | 48 GB | 8.000 bis 10.500 Euro | mittlere Modelle, Einstieg in Produktion |
| NVIDIA A100, gebraucht | 40 bis 80 GB | ab 8.000 bis 12.000 Euro | preisbewusster Einstieg |
| Mac Studio | je nach Konfiguration | 7.500 bis 12.000 Euro | Prototypen vor der Serverinvestition |
Die Preise für die notwendigen Grafikprozessoren schwanken deutlich je nach Leistungsklasse (ki-spezial.systems, 04/2026). Diese Anschaffungspreise sind aber nur ein Teil der Rechnung.
der Gesamtkosten über fünf Jahre entfallen auf die Hardware selbst. Der Rest verteilt sich auf Strom, Kühlung und Personal für Betrieb und Wartung.
Introl, GPU Infrastructure TCO 5-Year Cost Model, 04/2026
Wer nur den Kaufpreis der Karten vergleicht, unterschätzt die tatsächliche Belastung um mehr als das Doppelte. Zur Kühlung und zum Strombedarf kommt bei größeren Installationen die Frage nach dem verfügbaren Platz im Serverraum. Nicht jeder Betrieb hat die notwendige Stromversorgung oder Klimatisierung bereits vorhanden, ein Umbau kann die Anfangsinvestition zusätzlich erhöhen und sollte vor der Hardwarebestellung geprüft werden.
Ab wann sich ein On-Premise-LLM gegenüber einer Cloud-API rechnet
Bei hohem Anfragevolumen amortisiert sich ein eigener Betrieb gegenüber einer Cloud-API oft innerhalb von drei bis sechs Monaten (Meta Intelligence, 08/2025). Der Grund liegt in der Abrechnungslogik der meisten Cloud-Anbieter, die nach Token abrechnen. Bei tausenden Anfragen pro Tag summieren sich diese Kosten schneller, als viele Unternehmen erwarten.
Die Grenze zwischen den beiden Fällen lässt sich nicht pauschal in einer Zahl festlegen, sie hängt vom konkreten Modell, vom Anbieterpreis und von den eigenen Stromkosten ab. Eine Beispielrechnung mit dem tatsächlich erwarteten Anfragevolumen ist der einzig verlässliche Weg, diese Grenze für den eigenen Betrieb zu bestimmen. Wie eine solche Rechnung aufgebaut wird, steht im Beitrag zum ROI von KI-Projekten.
Welche Modellgröße für welchen Zweck sinnvoll ist
Nicht jede Aufgabe braucht das größte verfügbare Modell. Eine interne Dokumentensuche kommt oft mit einem kleineren, günstiger zu betreibenden Modell aus, während komplexe Analyseaufgaben von einem größeren Modell profitieren. Diese Entscheidung sollte vor dem Hardwarekauf fallen, nicht danach, weil sie direkt bestimmt, welche Grafikprozessoren überhaupt notwendig sind.
Eine Übersicht gängiger Open-Source-Modelle und ihrer Stärken findet sich im Beitrag Mistral, Llama und Qwen im Vergleich. Wer die Modellwahl mit der Hardwareplanung verknüpft, vermeidet den häufigen Fehler, zuerst Server zu bestellen und danach festzustellen, dass das gewünschte Modell mehr oder weniger Speicher braucht als eingeplant.
Wartung, Updates und der hybride Mittelweg
Ein eigenes System läuft nicht von selbst. Modelle brauchen regelmäßige Updates, Sicherheitspatches und eine Überwachung der Auslastung. Wer diesen Aufwand nicht selbst leisten kann, sollte ihn von Anfang an in die Personalkosten der TCO-Rechnung einplanen, statt ihn später als Überraschung zu entdecken.
Ein neues Open-Source-Modell erscheint oft innerhalb weniger Monate, mit Verbesserungen gegenüber der Vorversion. Ein Unternehmen, das die eigene Infrastruktur betreibt, muss entscheiden, ob und wann es wechselt. Diese Entscheidung braucht einen festen Prozess, sonst läuft ein Betrieb über Jahre mit einem veralteten Modell, obwohl bessere Alternativen längst verfügbar sind.
Viele Unternehmen fahren gut mit einer Mischung: sensible Anwendungsfälle laufen On-Premise, weniger kritische Aufgaben über eine Cloud-API. Diese hybride Aufstellung senkt die Fixkosten, ohne die Datenschutzanforderungen bei den wirklich sensiblen Prozessen zu gefährden. Der Übergang zwischen beiden Welten muss dabei strikt getrennt sein, damit nicht versehentlich sensible Daten über die falsche Schnittstelle nach außen gehen.
Eigener Betrieb oder Cloud?Nennen Sie uns Ihr erwartetes Anfragevolumen und den Anwendungsfall. Wir rechnen beide Varianten über fünf Jahre gegeneinander.
Häufige Fragen
Welche Modellgröße passt zu welchem Anwendungsfall?
Kleinere Modelle reichen für strukturierte Aufgaben wie Dokumentensuche oder Zusammenfassungen. Komplexe Analyse- oder Programmieraufgaben profitieren von größeren Modellen, die entsprechend mehr Grafikspeicher und damit teurere Hardware verlangen.
Was ist mit Wartung und Updates eines On-Premise-LLM?
Der Betrieb verlangt laufende Aufmerksamkeit für Sicherheitsupdates, Modellaktualisierungen und die Überwachung der Serverauslastung. Dieser Personalaufwand gehört in die TCO-Rechnung, er fällt über die gesamte Nutzungsdauer regelmäßig an, nicht nur beim Aufbau. Wer intern keine passende Kapazität hat, kann den Betrieb an einen externen Partner übergeben, was die Personalkosten durch eine feste Servicepauschale ersetzt.
Lässt sich Cloud und On-Premise kombinieren?
Ja, ein hybrider Ansatz ist in der Praxis üblich. Sensible Daten und Anwendungsfälle mit hohem Volumen laufen im eigenen Haus, weniger kritische Aufgaben über eine Cloud-API. Diese Aufteilung senkt die notwendige Anfangsinvestition und lässt sich später erweitern, etwa wenn ein zunächst über die Cloud getesteter Anwendungsfall wächst.
Der nächste Schritt
torck baut und betreibt On-Premise-LLM-Systeme für Industrie und Handel selbst, mit eigenen Entwicklungsteams in Maxhütte-Haidhof, Wien und Rabat. Wir rechnen Hardwarekosten und laufenden Betrieb gegen eine Cloud-API durch, bevor eine Entscheidung fällt. Im Erstgespräch prüfen wir, ob sich ein eigener Betrieb für das erwartete Anfragevolumen lohnt. Erstgespräch vereinbaren.