Private KI-Modelle: On-Premise-LLMs für sensible Daten


Titelbild: On-Premise-LLM auf eigener Hardware statt in der Cloud

Ein On-Premise-LLM im Unternehmen läuft auf eigener Hardware statt in der Cloud eines Anbieters. Für Betriebe, die mit Konstruktionsdaten, Kundendaten oder Verträgen arbeiten, ist das oft der einzig akzeptable Weg, ein Sprachmodell produktiv einzusetzen. Die Technik ist dabei selten das Problem. Es geht darum, ob sich der Betrieb rechnet.

Kurz beantwortet

Ein On-Premise-LLM lohnt sich bei hohem Anfragevolumen, dort amortisiert er sich oft in drei bis sechs Monaten gegenüber einer Cloud-API. Bei wenigen hundert Anfragen im Monat bleibt die Cloud günstiger. Die Hardware macht über fünf Jahre nur rund 35 Prozent der Gesamtkosten aus, der Rest sind Strom, Kühlung und Personal.

Was ein On-Premise-LLM an Hardware kostet

Preise für Grafikprozessoren, Stand 04/2026, Quelle: ki-spezial.systems
Modell Speicher Preis Geeignet für
NVIDIA H200 141 GB 34.000 bis 42.000 Euro große Modelle, hohes Volumen
NVIDIA H100 80 GB 26.000 bis 32.000 Euro produktiver Regelbetrieb
NVIDIA L40S 48 GB 8.000 bis 10.500 Euro mittlere Modelle, Einstieg in Produktion
NVIDIA A100, gebraucht 40 bis 80 GB ab 8.000 bis 12.000 Euro preisbewusster Einstieg
Mac Studio je nach Konfiguration 7.500 bis 12.000 Euro Prototypen vor der Serverinvestition

Die Preise für die notwendigen Grafikprozessoren schwanken deutlich je nach Leistungsklasse (ki-spezial.systems, 04/2026). Diese Anschaffungspreise sind aber nur ein Teil der Rechnung.

35 %

der Gesamtkosten über fünf Jahre entfallen auf die Hardware selbst. Der Rest verteilt sich auf Strom, Kühlung und Personal für Betrieb und Wartung.

Introl, GPU Infrastructure TCO 5-Year Cost Model, 04/2026

Wer nur den Kaufpreis der Karten vergleicht, unterschätzt die tatsächliche Belastung um mehr als das Doppelte. Zur Kühlung und zum Strombedarf kommt bei größeren Installationen die Frage nach dem verfügbaren Platz im Serverraum. Nicht jeder Betrieb hat die notwendige Stromversorgung oder Klimatisierung bereits vorhanden, ein Umbau kann die Anfangsinvestition zusätzlich erhöhen und sollte vor der Hardwarebestellung geprüft werden.

Ab wann sich ein On-Premise-LLM gegenüber einer Cloud-API rechnet

Bei hohem Anfragevolumen amortisiert sich ein eigener Betrieb gegenüber einer Cloud-API oft innerhalb von drei bis sechs Monaten (Meta Intelligence, 08/2025). Der Grund liegt in der Abrechnungslogik der meisten Cloud-Anbieter, die nach Token abrechnen. Bei tausenden Anfragen pro Tag summieren sich diese Kosten schneller, als viele Unternehmen erwarten.

Wo die Rechnung kipptBei kleinem oder unregelmäßigem Volumen bleibt eine Cloud-API günstiger, weil keine Fixkosten für Hardware, Strom und Wartung anfallen, unabhängig von der Nutzung. Betriebe mit wenigen hundert Anfragen pro Monat sollten sich vom Argument der Datensouveränität nicht zu einer unwirtschaftlichen Investition verleiten lassen.

Die Grenze zwischen den beiden Fällen lässt sich nicht pauschal in einer Zahl festlegen, sie hängt vom konkreten Modell, vom Anbieterpreis und von den eigenen Stromkosten ab. Eine Beispielrechnung mit dem tatsächlich erwarteten Anfragevolumen ist der einzig verlässliche Weg, diese Grenze für den eigenen Betrieb zu bestimmen. Wie eine solche Rechnung aufgebaut wird, steht im Beitrag zum ROI von KI-Projekten.

Welche Modellgröße für welchen Zweck sinnvoll ist

Nicht jede Aufgabe braucht das größte verfügbare Modell. Eine interne Dokumentensuche kommt oft mit einem kleineren, günstiger zu betreibenden Modell aus, während komplexe Analyseaufgaben von einem größeren Modell profitieren. Diese Entscheidung sollte vor dem Hardwarekauf fallen, nicht danach, weil sie direkt bestimmt, welche Grafikprozessoren überhaupt notwendig sind.

Eine Übersicht gängiger Open-Source-Modelle und ihrer Stärken findet sich im Beitrag Mistral, Llama und Qwen im Vergleich. Wer die Modellwahl mit der Hardwareplanung verknüpft, vermeidet den häufigen Fehler, zuerst Server zu bestellen und danach festzustellen, dass das gewünschte Modell mehr oder weniger Speicher braucht als eingeplant.

Wartung, Updates und der hybride Mittelweg

Ein eigenes System läuft nicht von selbst. Modelle brauchen regelmäßige Updates, Sicherheitspatches und eine Überwachung der Auslastung. Wer diesen Aufwand nicht selbst leisten kann, sollte ihn von Anfang an in die Personalkosten der TCO-Rechnung einplanen, statt ihn später als Überraschung zu entdecken.

Ein neues Open-Source-Modell erscheint oft innerhalb weniger Monate, mit Verbesserungen gegenüber der Vorversion. Ein Unternehmen, das die eigene Infrastruktur betreibt, muss entscheiden, ob und wann es wechselt. Diese Entscheidung braucht einen festen Prozess, sonst läuft ein Betrieb über Jahre mit einem veralteten Modell, obwohl bessere Alternativen längst verfügbar sind.

Viele Unternehmen fahren gut mit einer Mischung: sensible Anwendungsfälle laufen On-Premise, weniger kritische Aufgaben über eine Cloud-API. Diese hybride Aufstellung senkt die Fixkosten, ohne die Datenschutzanforderungen bei den wirklich sensiblen Prozessen zu gefährden. Der Übergang zwischen beiden Welten muss dabei strikt getrennt sein, damit nicht versehentlich sensible Daten über die falsche Schnittstelle nach außen gehen.

Eigener Betrieb oder Cloud?Nennen Sie uns Ihr erwartetes Anfragevolumen und den Anwendungsfall. Wir rechnen beide Varianten über fünf Jahre gegeneinander.

Vergleich anfragen

Häufige Fragen

Welche Modellgröße passt zu welchem Anwendungsfall?

Kleinere Modelle reichen für strukturierte Aufgaben wie Dokumentensuche oder Zusammenfassungen. Komplexe Analyse- oder Programmieraufgaben profitieren von größeren Modellen, die entsprechend mehr Grafikspeicher und damit teurere Hardware verlangen.

Was ist mit Wartung und Updates eines On-Premise-LLM?

Der Betrieb verlangt laufende Aufmerksamkeit für Sicherheitsupdates, Modellaktualisierungen und die Überwachung der Serverauslastung. Dieser Personalaufwand gehört in die TCO-Rechnung, er fällt über die gesamte Nutzungsdauer regelmäßig an, nicht nur beim Aufbau. Wer intern keine passende Kapazität hat, kann den Betrieb an einen externen Partner übergeben, was die Personalkosten durch eine feste Servicepauschale ersetzt.

Lässt sich Cloud und On-Premise kombinieren?

Ja, ein hybrider Ansatz ist in der Praxis üblich. Sensible Daten und Anwendungsfälle mit hohem Volumen laufen im eigenen Haus, weniger kritische Aufgaben über eine Cloud-API. Diese Aufteilung senkt die notwendige Anfangsinvestition und lässt sich später erweitern, etwa wenn ein zunächst über die Cloud getesteter Anwendungsfall wächst.

Der nächste Schritt

torck baut und betreibt On-Premise-LLM-Systeme für Industrie und Handel selbst, mit eigenen Entwicklungsteams in Maxhütte-Haidhof, Wien und Rabat. Wir rechnen Hardwarekosten und laufenden Betrieb gegen eine Cloud-API durch, bevor eine Entscheidung fällt. Im Erstgespräch prüfen wir, ob sich ein eigener Betrieb für das erwartete Anfragevolumen lohnt. Erstgespräch vereinbaren.

Frage zu diesem Beitrag?

Zwei Sätze zu Ihrer Situation genügen. Es antwortet jemand, der solche Systeme selbst baut.

Antwort innerhalb eines Werktags.torck · Code mit Drehmoment
Florian Blischke
Geschäftsführer torck GmbH · über 20 Jahre Softwareentwicklung
Florian Blischke ist Geschäftsführer der torck GmbH und seit über 20 Jahren in der Softwareentwicklung tätig. Er verantwortet Individualsoftware für Industrie und Handel, von der Anbindung physischer Prozesse über IoT bis zu Cloud-Architektur und daten- sowie KI-gestützten Systemen. Bei torck begleitet er unter anderem die Energieplattform Jouvoli und das Fleet-Management-Produkt KVM Fleet. torck entwickelt an den Standorten Maxhütte-Haidhof, Wien und Rabat und legt Wert auf Software, die im Betrieb tatsächlich funktioniert.

Steht bei Ihnen dieselbe Frage an?

Wir bauen seit 2017 Software für Industrie und Handel, von Maxhütte-Haidhof aus, mit Teams in Wien und Rabat. Ein Erstgespräch dauert 30 Minuten und kostet nichts. Danach wissen Sie, ob sich das Vorhaben lohnt, auch wenn die Antwort nein lautet.

Weitere Beiträge