Welche lokalen LLMs für Coding infrage kommen
Nach dem Datenstand vom reicht der Speicher von Planungsprofil CUDA · 48 GiB rechnerisch für 126 von 1.092 erfassten Konfigurationen, davon 0 knapp. Annahmen: 32.768 Tokens Kontext, gleichzeitige Anfragen 1, Reserve 10 %. Nutzbar bleiben 43,2 GiB. Für 757 Konfigurationen fehlt noch ein vollständiger Speicherwert.
Erster Testkandidat ist Devstral-Small-2-24B-Instruct-2512 in Q4_K_M mit llama.cpp. Diese Konfiguration braucht bis 22,0 GiB, eine Tempo-Schätzung gibt es für dieses Gerät nicht. Runtime-Stand llama.cpp: Build b10964 vom 14.09.2026 (Quelle). Eignung: keine unabhängigen Daten. Speicher und Tempo sind gerechnet, nicht gemessen. Die Eignung für Ihre Aufgabe zeigt erst ein Test mit eigenen Fragen.
Ihre Anforderungen
400 berechenbare Modelle · 1.092 Konfigurationen · 93 Hardwareoptionen · DatenstandErgebnisse 1092
20 von 1.092 Ergebnissen, Seite 1 von 55.
Berechneter Speicherbedarf: Speicher reicht rechnerisch: 126 · An der Speichergrenze: 3 · Speicherbedarf noch offen: 757 · Benötigt mehr Speicher: 206 · Datenstand
Was die Zeichen bedeuten
- in Ordnung: Der Speicher reicht rechnerisch, oder die Zahl daneben ist gemessen.
- mit Vorbehalt: Reicht knapp, liegt an der Speichergrenze oder braucht CPU-Offload. Der Satz daneben nennt den Fall.
- nicht möglich: Es fehlt Speicher, oder Laufzeit und Hardware passen nicht zusammen.
- offen: Eine Angabe fehlt im Datenstand, der Wert ist nicht zu berechnen.
- geschätzt: Gerechnet, nicht gemessen.
- belegt: Gemessen, Quelle und Herkunft stehen in den Einzelheiten.
Modelle für den ersten Test
Richtgröße für diese Aufgabe: 10 Tokens pro Sekunde. Das ist eine Annahme von torck, eine belegte Schwelle gibt es dafür nicht.
Erster Testkandidat
Devstral-Small-2-24B-Instruct-2512
Repository angelegt am 28.11.2025 huggingface.co / Devstral-Small-2-24B-Instruct-2512
- Speicher reicht rechnerisch, 21,2 GiB bleiben frei
- Geschwindigkeit nicht schätzbar
- Eignung: keine unabhängigen Daten
Passt mit Reserve in den Speicher. Geschwindigkeit nicht geschätzt. Gereiht wurde nach Größe, soweit sie ausreicht, danach nach Aktualität und Beleglage. Prüfen Sie die Eignung mit 20 eigenen Aufgaben aus Ihrem Code und lassen Sie Ihre Tests darüber laufen.
Speicherbedarf
- Bedarf je Gerät
- 19,3 bis 22,0 GiB
- Verfügbar je Gerät
- 43,2 GiB
Antwortgeschwindigkeit
Eignung für Ihre Aufgabe
Für Devstral-Small-2-24B-Instruct-2512 liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.
Der Katalog nennt 24,0 Milliarden Parameter, 262.144 Tokens Kontextlänge und das Anlagedatum 28.11.2025. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.
Modellkarte von Devstral-Small-2-24B-Instruct-2512 beim Herausgeber öffnen
Offene Punkte
Info
- Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
Nächster Platz der Rangfolge
Magistral-Small-2509
Repository angelegt am 12.09.2025 huggingface.co / Magistral-Small-2509
- Speicher reicht rechnerisch, 21,2 GiB bleiben frei
- Geschwindigkeit nicht schätzbar
- Eignung: keine unabhängigen Daten
Steht in der Rangfolge direkt hinter dem ersten Testkandidaten. Über die Antwortqualität sagt der Platz nichts.
Speicherbedarf
- Bedarf je Gerät
- 19,3 bis 22,0 GiB
- Verfügbar je Gerät
- 43,2 GiB
Antwortgeschwindigkeit
Eignung für Ihre Aufgabe
Für Magistral-Small-2509 liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.
Der Katalog nennt 24,0 Milliarden Parameter, 131.072 Tokens Kontextlänge und das Anlagedatum 12.09.2025. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.
Modellkarte von Magistral-Small-2509 beim Herausgeber öffnen
Offene Punkte
Info
- Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
Nächster Platz der Rangfolge
Mistral-Small-3.2-24B-Instruct-2506
Repository angelegt am 19.06.2025 huggingface.co / Mistral-Small-3.2-24B-Instruct-2506
- Speicher reicht rechnerisch, 21,2 GiB bleiben frei
- Geschwindigkeit nicht schätzbar
- Eignung: nur Herstellerangaben
Steht in der Rangfolge direkt hinter dem ersten Testkandidaten. Über die Antwortqualität sagt der Platz nichts.
Speicherbedarf
- Bedarf je Gerät
- 19,3 bis 22,0 GiB
- Verfügbar je Gerät
- 43,2 GiB
Antwortgeschwindigkeit
Eignung für Ihre Aufgabe
HerstellerangabeHumanEval Plus: 92,9 %
Angabe für die Modellvariante. Für diese Quantisierung liegt keine Messung vor.Herstellerangabe zu HumanEval Plus mit bis zu fünf Versuchen (Pass@5). Nicht mit Ergebnissen für einen einzelnen Versuch vergleichbar.Hugging Face Hub · 20.06.2025Offene Punkte
Info
- Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
Die Liste ist durchgehend nach derselben Rangfolge sortiert. Zuerst stehen Konfigurationen, für die geprüfte Daten vorliegen. Dann zählt, ob die geschätzte Mindestgeschwindigkeit beim gewählten Kontext die Richtgröße für Ihre Aufgabe erreicht. Danach gewinnt die größere Größenklasse, innerhalb einer Größenklasse das Modell mit dem jüngeren Anlagedatum des Repositorys, dann die höhere Parameterzahl, zuletzt der freie Speicher und geprüfte Laufzeitangaben. Über die Antwortqualität sagt die Reihenfolge nichts.
Entscheidungsvorlage und Testplan
Entscheidungsvorlage und Testplan
Datenstand: 19.09.2026
Kontext: 32.768 Tokens. Gleichzeitige Anfragen: 1. Reserve: 10 %.
Diese Auswahl liefert Kandidaten für einen Praxistest. Speicher und Tempo sind Schätzungen. Die Rangfolge belegt keine fachliche Qualität oder Freigabe für den Produktivbetrieb.
- Einstieg
- Ich habe einen Anwendungsfall
- Aufgabe
- Coding
- Sprache der Anwendung
- Keine Vorgabe
- Anzahl identischer Geräte
- 1
- Verteilung
- Ein Gerät
- KV-Cache: Bits pro Wert
- 16
- KV-Cache: Speicherort
- GPU / Unified Memory
- Zusatzspeicher (Workspace), Minimum je Gerät in GiB
- 1
- Zusatzspeicher (Workspace), Maximum je Gerät in GiB
- 3
- Host-RAM (GiB)
- 64
- CPU-Offload berücksichtigen
- Nein
- Bilder und gescannte Dokumente verarbeiten
- Nein
- Externe Werkzeuge aufrufen
- Nein
- Für geschäftliche Nutzung
- Nein
- Unabhängige Tests für die gewählte Sprache
- Nein
Rechenweg: Speicher nach memory-envelope-v1, Rangfolge nach shortlist-rank-v3.
Devstral-Small-2-24B-Instruct-2512
Planungsprofil CUDA · 48 GiB · Q4_K_M · llama.cpp b10964
Passt mit Reserve in den Speicher. Geschwindigkeit nicht geschätzt. Gereiht wurde nach Größe, soweit sie ausreicht, danach nach Aktualität und Beleglage. Prüfen Sie die Eignung mit 20 eigenen Aufgaben aus Ihrem Code und lassen Sie Ihre Tests darüber laufen.
- Speicher reicht rechnerisch, 21,2 GiB bleiben frei
- Geschwindigkeit nicht schätzbar
- Eignung: keine unabhängigen Daten
Bedarf je Gerät: 19,3 bis 22,0 GiB · Verfügbar je Gerät: 43,2 GiB
Keine belastbare Temposchätzung für diese Vorgaben. Messen Sie Antwortbeginn und Generierung mit dem geplanten Kontext und parallelen Anfragen.
Vor dem Pilot klären
- Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
Starten Sie die genannte Konfiguration auf dem Zielgerät. Protokollieren Sie Modellrevision, Runtime-Version, Speichermaximum und Laufzeitfehler.
Magistral-Small-2509
Planungsprofil CUDA · 48 GiB · Q4_K_M · llama.cpp b10964
Steht in der Rangfolge direkt hinter dem ersten Testkandidaten. Über die Antwortqualität sagt der Platz nichts.
- Speicher reicht rechnerisch, 21,2 GiB bleiben frei
- Geschwindigkeit nicht schätzbar
- Eignung: keine unabhängigen Daten
Bedarf je Gerät: 19,3 bis 22,0 GiB · Verfügbar je Gerät: 43,2 GiB
Keine belastbare Temposchätzung für diese Vorgaben. Messen Sie Antwortbeginn und Generierung mit dem geplanten Kontext und parallelen Anfragen.
Vor dem Pilot klären
- Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
Starten Sie die genannte Konfiguration auf dem Zielgerät. Protokollieren Sie Modellrevision, Runtime-Version, Speichermaximum und Laufzeitfehler.
Mistral-Small-3.2-24B-Instruct-2506
Planungsprofil CUDA · 48 GiB · Q4_K_M · llama.cpp b10964
Steht in der Rangfolge direkt hinter dem ersten Testkandidaten. Über die Antwortqualität sagt der Platz nichts.
- Speicher reicht rechnerisch, 21,2 GiB bleiben frei
- Geschwindigkeit nicht schätzbar
- Eignung: nur Herstellerangaben
Bedarf je Gerät: 19,3 bis 22,0 GiB · Verfügbar je Gerät: 43,2 GiB
Keine belastbare Temposchätzung für diese Vorgaben. Messen Sie Antwortbeginn und Generierung mit dem geplanten Kontext und parallelen Anfragen.
Vor dem Pilot klären
- Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
Starten Sie die genannte Konfiguration auf dem Zielgerät. Protokollieren Sie Modellrevision, Runtime-Version, Speichermaximum und Laufzeitfehler.
Abnahme mit eigenen Aufgaben
Für Coding zählt, ob erzeugter Code Ihre Tests besteht. Lassen Sie das Modell Aufgaben aus Ihrem eigenen Code lösen und führen Sie Ihre vorhandenen Tests auf dem Ergebnis aus. Maßstab ist der Anteil bestandener Tests.
Vorschlag für den Pilot: 20 typische Fälle mit vorab festgelegten Sollantworten, darunter Fehlerfälle und Fragen ohne belegbare Antwort. Nutzen Sie für alle Kandidaten dieselben Prompts und Dokumente. Legen Sie vor dem Test Mindestqualität und maximale Wartezeit fest. Erfassen Sie pro Fall die fachliche Bewertung, Quellenfehler, Antwortbeginn und Gesamtdauer. Wiederholen Sie den Lauf unter geplanter Parallelität.
Der Ergebnislink öffnet die Rechnung mit diesen Annahmen und den Quellen. Der Katalog wird aktualisiert, spätere Ergebnisse können abweichen. Für eine nachvollziehbare Ablage speichern Sie zusätzlich den JSON-Export mit den Quellen und dem Datenstand.
Lokaler Betrieb und API: eigene Kostenrechnung
Alle Beträge sind eigene Annahmen in EUR netto. Die Felder bleiben auf diesem Gerät. Beim Herunterladen der Entscheidungsvorlage werden sie in die Datei aufgenommen. Tragen Sie für nicht anfallende Kosten 0 ein. Vergleichen Sie nur Angebote mit der benötigten Qualität, Verfügbarkeit und Datenverarbeitung.
Lokal pro Monat = Anschaffung ÷ Nutzungsdauer + W ÷ 1000 × Stunden × Strompreis + Betrieb. API pro Monat = Anfragen × (Input-Tokens × Inputpreis + Output-Tokens × Outputpreis) ÷ 1.000.000. Zusatzkosten wie Retrieval, Speicher, Ausfallsicherung und API-Grundgebühren separat berücksichtigen. Die Rechnung prüft weder Kapazität noch vergleichbare Antwortqualität.
Gilt für alle Ergebnisse
Kontext: 32.768 Tokens. Gleichzeitige Anfragen: 1. Reserve: 10 %.
Die Geschwindigkeit ist geschätzt. Ob ein Modell Ihre Aufgaben gut löst, zeigt erst ein Test mit eigenen Beispielen. Der Speicherbedarf ist berechnet, nicht gemessen. Die Lizenzinformationen ersetzen keine rechtliche Prüfung für Ihren Einsatz.
Eignung für Ihre Aufgabe selbst testen
Für Coding zählt, ob erzeugter Code Ihre Tests besteht. Lassen Sie das Modell Aufgaben aus Ihrem eigenen Code lösen und führen Sie Ihre vorhandenen Tests auf dem Ergebnis aus. Maßstab ist der Anteil bestandener Tests.
So rechnet der Finder
Wer selbst misst, liest den Wert in der Zeile tg128 von llama-bench. Das ist die Antwortgeschwindigkeit in Tokens pro Sekunde.
Für diese Hardware liegt keine belegte Speicherbandbreite vor.
Zum Messen führen Sie llama-bench mit Ihrer Modelldatei aus. Anleitung zu llama-bench
„Offiziell gebaut“ ist keine Aussage über Geschwindigkeit oder fehlerfreie Ausgabe.
Alle 1.092 Konfigurationen
Devstral-Small-2-24B-Instruct-2512
Repository angelegt am 28.11.2025 huggingface.co / Devstral-Small-2-24B-Instruct-2512
- Speicher reicht rechnerisch, 21,2 GiB bleiben frei
- Geschwindigkeit nicht schätzbar
- Eignung: keine unabhängigen Daten
Speicherbedarf
- Bedarf je Gerät
- 19,3 bis 22,0 GiB
- Verfügbar je Gerät
- 43,2 GiB
Antwortgeschwindigkeit
Eignung für Ihre Aufgabe
Für Devstral-Small-2-24B-Instruct-2512 liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.
Der Katalog nennt 24,0 Milliarden Parameter, 262.144 Tokens Kontextlänge und das Anlagedatum 28.11.2025. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.
Modellkarte von Devstral-Small-2-24B-Instruct-2512 beim Herausgeber öffnen
Offene Punkte
Info
- Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
Warum diese Einschätzung
Devstral-Small-2-24B-Instruct-2512
Repository angelegt am 28.11.2025 huggingface.co / Devstral-Small-2-24B-Instruct-2512
- Speicher reicht rechnerisch, 10,9 GiB bleiben frei
- Geschwindigkeit nicht schätzbar
- Eignung: keine unabhängigen Daten
Speicherbedarf
- Bedarf je Gerät
- 29,3 bis 32,3 GiB
- Verfügbar je Gerät
- 43,2 GiB
Antwortgeschwindigkeit
Eignung für Ihre Aufgabe
Für Devstral-Small-2-24B-Instruct-2512 liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.
Der Katalog nennt 24,0 Milliarden Parameter, 262.144 Tokens Kontextlänge und das Anlagedatum 28.11.2025. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.
Modellkarte von Devstral-Small-2-24B-Instruct-2512 beim Herausgeber öffnen
Offene Punkte
Info
- Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
Warum diese Einschätzung
Magistral-Small-2509
Repository angelegt am 12.09.2025 huggingface.co / Magistral-Small-2509
- Speicher reicht rechnerisch, 21,2 GiB bleiben frei
- Geschwindigkeit nicht schätzbar
- Eignung: keine unabhängigen Daten
Speicherbedarf
- Bedarf je Gerät
- 19,3 bis 22,0 GiB
- Verfügbar je Gerät
- 43,2 GiB
Antwortgeschwindigkeit
Eignung für Ihre Aufgabe
Für Magistral-Small-2509 liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.
Der Katalog nennt 24,0 Milliarden Parameter, 131.072 Tokens Kontextlänge und das Anlagedatum 12.09.2025. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.
Modellkarte von Magistral-Small-2509 beim Herausgeber öffnen
Offene Punkte
Info
- Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
Warum diese Einschätzung
Magistral-Small-2509
Repository angelegt am 12.09.2025 huggingface.co / Magistral-Small-2509
- Speicher reicht rechnerisch, 10,9 GiB bleiben frei
- Geschwindigkeit nicht schätzbar
- Eignung: keine unabhängigen Daten
Speicherbedarf
- Bedarf je Gerät
- 29,3 bis 32,3 GiB
- Verfügbar je Gerät
- 43,2 GiB
Antwortgeschwindigkeit
Eignung für Ihre Aufgabe
Für Magistral-Small-2509 liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.
Der Katalog nennt 24,0 Milliarden Parameter, 131.072 Tokens Kontextlänge und das Anlagedatum 12.09.2025. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.
Modellkarte von Magistral-Small-2509 beim Herausgeber öffnen
Offene Punkte
Info
- Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
Warum diese Einschätzung
Mistral-Small-3.2-24B-Instruct-2506
Repository angelegt am 19.06.2025 huggingface.co / Mistral-Small-3.2-24B-Instruct-2506
- Speicher reicht rechnerisch, 21,2 GiB bleiben frei
- Geschwindigkeit nicht schätzbar
- Eignung: nur Herstellerangaben
Speicherbedarf
- Bedarf je Gerät
- 19,3 bis 22,0 GiB
- Verfügbar je Gerät
- 43,2 GiB
Antwortgeschwindigkeit
Eignung für Ihre Aufgabe
HerstellerangabeHumanEval Plus: 92,9 %
Angabe für die Modellvariante. Für diese Quantisierung liegt keine Messung vor.Herstellerangabe zu HumanEval Plus mit bis zu fünf Versuchen (Pass@5). Nicht mit Ergebnissen für einen einzelnen Versuch vergleichbar.Hugging Face Hub · 20.06.2025Offene Punkte
Info
- Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
Warum diese Einschätzung
Mistral-Small-3.2-24B-Instruct-2506
Repository angelegt am 19.06.2025 huggingface.co / Mistral-Small-3.2-24B-Instruct-2506
- Speicher reicht rechnerisch, 10,9 GiB bleiben frei
- Geschwindigkeit nicht schätzbar
- Eignung: nur Herstellerangaben
Speicherbedarf
- Bedarf je Gerät
- 29,3 bis 32,3 GiB
- Verfügbar je Gerät
- 43,2 GiB
Antwortgeschwindigkeit
Eignung für Ihre Aufgabe
HerstellerangabeHumanEval Plus: 92,9 %
Angabe für die Modellvariante. Für diese Quantisierung liegt keine Messung vor.Herstellerangabe zu HumanEval Plus mit bis zu fünf Versuchen (Pass@5). Nicht mit Ergebnissen für einen einzelnen Versuch vergleichbar.Hugging Face Hub · 20.06.2025Offene Punkte
Info
- Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
Warum diese Einschätzung
Test mit Ihren eigenen AufgabenDie Liste zeigt Rechenwerte. Ob ein Modell Ihre Aufgaben löst, zeigt erst ein Test mit Ihren eigenen Daten.
Magistral-Small-2506
Repository angelegt am 04.06.2025 huggingface.co / Magistral-Small-2506
- Speicher reicht rechnerisch, 21,2 GiB bleiben frei
- Geschwindigkeit nicht schätzbar
- Eignung: keine unabhängigen Daten
Speicherbedarf
- Bedarf je Gerät
- 19,3 bis 22,0 GiB
- Verfügbar je Gerät
- 43,2 GiB
Antwortgeschwindigkeit
Eignung für Ihre Aufgabe
Für Magistral-Small-2506 liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.
Der Katalog nennt 23,6 Milliarden Parameter, 40.960 Tokens Kontextlänge und das Anlagedatum 04.06.2025. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.
Modellkarte von Magistral-Small-2506 beim Herausgeber öffnen
Offene Punkte
Info
- Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
Warum diese Einschätzung
Magistral-Small-2506
Repository angelegt am 04.06.2025 huggingface.co / Magistral-Small-2506
- Speicher reicht rechnerisch, 10,9 GiB bleiben frei
- Geschwindigkeit nicht schätzbar
- Eignung: keine unabhängigen Daten
Speicherbedarf
- Bedarf je Gerät
- 29,3 bis 32,3 GiB
- Verfügbar je Gerät
- 43,2 GiB
Antwortgeschwindigkeit
Eignung für Ihre Aufgabe
Für Magistral-Small-2506 liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.
Der Katalog nennt 23,6 Milliarden Parameter, 40.960 Tokens Kontextlänge und das Anlagedatum 04.06.2025. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.
Modellkarte von Magistral-Small-2506 beim Herausgeber öffnen
Offene Punkte
Info
- Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
Warum diese Einschätzung
Qwen3-32B
Repository angelegt am 27.04.2025 huggingface.co / Qwen3-32B
- Speicher reicht rechnerisch, 13,3 GiB bleiben frei
- Geschwindigkeit nicht schätzbar
- Eignung: keine unabhängigen Daten
Speicherbedarf
- Bedarf je Gerät
- 27,0 bis 29,9 GiB
- Verfügbar je Gerät
- 43,2 GiB
Antwortgeschwindigkeit
Der Effizienzkorridor der Schätzung stammt aus einer Messreihe zu llama.cpp. Für andere Runtimes ist er nicht geprüft.Mit vLLM, unter Last oder mit Multi-Token-Prediction können reale Werte deutlich abweichen.Eignung für Ihre Aufgabe
Für Qwen3-32B liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.
Der Katalog nennt 32,8 Milliarden Parameter, 32.768 Tokens Kontextlänge und das Anlagedatum 27.04.2025. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.
Offene Punkte
Hinweis
- Für diese Karte ist keine Rechenfähigkeit hinterlegt, deshalb bleibt offen, ob vLLM das Format darauf rechnet. Lesen Sie die Stufe mit nvidia-smi --query-gpu=compute_cap --format=csv aus und vergleichen Sie sie mit der Angabe der Quantisierung.
Info
- Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
Warum diese Einschätzung
Qwen3-32B
Repository angelegt am 27.04.2025 huggingface.co / Qwen3-32B
- Speicher reicht rechnerisch, 12,8 GiB bleiben frei
- Geschwindigkeit nicht schätzbar
- Eignung: keine unabhängigen Daten
Speicherbedarf
- Bedarf je Gerät
- 27,4 bis 30,4 GiB
- Verfügbar je Gerät
- 43,2 GiB
Antwortgeschwindigkeit
Eignung für Ihre Aufgabe
Für Qwen3-32B liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.
Der Katalog nennt 32,8 Milliarden Parameter, 32.768 Tokens Kontextlänge und das Anlagedatum 27.04.2025. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.
Offene Punkte
Info
- Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
Warum diese Einschätzung
Qwen3-32B
Repository angelegt am 27.04.2025 huggingface.co / Qwen3-32B
- Speicher reicht rechnerisch, 12,0 GiB bleiben frei
- Geschwindigkeit nicht schätzbar
- Eignung: keine unabhängigen Daten
Speicherbedarf
- Bedarf je Gerät
- 28,2 bis 31,2 GiB
- Verfügbar je Gerät
- 43,2 GiB
Antwortgeschwindigkeit
Der Effizienzkorridor der Schätzung stammt aus einer Messreihe zu llama.cpp. Für andere Runtimes ist er nicht geprüft.Mit vLLM, unter Last oder mit Multi-Token-Prediction können reale Werte deutlich abweichen.Eignung für Ihre Aufgabe
Für Qwen3-32B liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.
Der Katalog nennt 32,8 Milliarden Parameter, 32.768 Tokens Kontextlänge und das Anlagedatum 27.04.2025. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.
Offene Punkte
Hinweis
- Für diese Karte ist keine Rechenfähigkeit hinterlegt, deshalb bleibt offen, ob vLLM das Format darauf rechnet. Lesen Sie die Stufe mit nvidia-smi --query-gpu=compute_cap --format=csv aus und vergleichen Sie sie mit der Angabe der Quantisierung.
Info
- Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
Warum diese Einschätzung
Mistral-Small-3.1-24B-Instruct-2503
Repository angelegt am 11.03.2025 huggingface.co / Mistral-Small-3.1-24B-Instruct-2503
- Speicher reicht rechnerisch, 21,2 GiB bleiben frei
- Geschwindigkeit nicht schätzbar
- Eignung: keine unabhängigen Daten
Speicherbedarf
- Bedarf je Gerät
- 19,3 bis 22,0 GiB
- Verfügbar je Gerät
- 43,2 GiB
Antwortgeschwindigkeit
Eignung für Ihre Aufgabe
Für Mistral-Small-3.1-24B-Instruct-2503 liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.
Der Katalog nennt 24,0 Milliarden Parameter, 131.072 Tokens Kontextlänge und das Anlagedatum 11.03.2025. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.
Modellkarte von Mistral-Small-3.1-24B-Instruct-2503 beim Herausgeber öffnen
Offene Punkte
Info
- Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
Warum diese Einschätzung
Test mit Ihren eigenen AufgabenDie Liste zeigt Rechenwerte. Ob ein Modell Ihre Aufgaben löst, zeigt erst ein Test mit Ihren eigenen Daten.
Mistral-Small-3.1-24B-Instruct-2503
Repository angelegt am 11.03.2025 huggingface.co / Mistral-Small-3.1-24B-Instruct-2503
- Speicher reicht rechnerisch, 10,9 GiB bleiben frei
- Geschwindigkeit nicht schätzbar
- Eignung: keine unabhängigen Daten
Speicherbedarf
- Bedarf je Gerät
- 29,3 bis 32,3 GiB
- Verfügbar je Gerät
- 43,2 GiB
Antwortgeschwindigkeit
Eignung für Ihre Aufgabe
Für Mistral-Small-3.1-24B-Instruct-2503 liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.
Der Katalog nennt 24,0 Milliarden Parameter, 131.072 Tokens Kontextlänge und das Anlagedatum 11.03.2025. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.
Modellkarte von Mistral-Small-3.1-24B-Instruct-2503 beim Herausgeber öffnen
Offene Punkte
Info
- Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
Warum diese Einschätzung
DeepSeek-R1-Distill-Qwen-32B
Repository angelegt am 20.01.2025 huggingface.co / DeepSeek-R1-Distill-Qwen-32B
- Speicher reicht rechnerisch, 12,8 GiB bleiben frei
- Geschwindigkeit nicht schätzbar
- Eignung: keine unabhängigen Daten
Speicherbedarf
- Bedarf je Gerät
- 27,5 bis 30,4 GiB
- Verfügbar je Gerät
- 43,2 GiB
Antwortgeschwindigkeit
Eignung für Ihre Aufgabe
Für DeepSeek-R1-Distill-Qwen-32B liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.
Der Katalog nennt 32,8 Milliarden Parameter, 131.072 Tokens Kontextlänge und das Anlagedatum 20.01.2025. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.
Modellkarte von DeepSeek-R1-Distill-Qwen-32B beim Herausgeber öffnen
Offene Punkte
Info
- Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
Warum diese Einschätzung
Codestral-22B-v0.1
Repository angelegt am 29.05.2024 huggingface.co / Codestral-22B-v0.1
- Speicher reicht rechnerisch, 20,1 GiB bleiben frei
- Geschwindigkeit nicht schätzbar
- Eignung: keine unabhängigen Daten
Speicherbedarf
- Bedarf je Gerät
- 20,4 bis 23,1 GiB
- Verfügbar je Gerät
- 43,2 GiB
Antwortgeschwindigkeit
Eignung für Ihre Aufgabe
Für Codestral-22B-v0.1 liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.
Der Katalog nennt 22,2 Milliarden Parameter, 32.768 Tokens Kontextlänge und das Anlagedatum 29.05.2024. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.
Offene Punkte
Info
- Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
Warum diese Einschätzung
Codestral-22B-v0.1
Repository angelegt am 29.05.2024 huggingface.co / Codestral-22B-v0.1
- Speicher reicht rechnerisch, 10,2 GiB bleiben frei
- Geschwindigkeit nicht schätzbar
- Eignung: keine unabhängigen Daten
Speicherbedarf
- Bedarf je Gerät
- 30,0 bis 33,0 GiB
- Verfügbar je Gerät
- 43,2 GiB
Antwortgeschwindigkeit
Eignung für Ihre Aufgabe
Für Codestral-22B-v0.1 liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.
Der Katalog nennt 22,2 Milliarden Parameter, 32.768 Tokens Kontextlänge und das Anlagedatum 29.05.2024. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.
Offene Punkte
Info
- Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
Warum diese Einschätzung
DeepSeek-R1-0528-Qwen3-8B
Repository angelegt am 29.05.2025 huggingface.co / DeepSeek-R1-0528-Qwen3-8B
- Speicher reicht rechnerisch, 30,7 GiB bleiben frei
- Geschwindigkeit nicht schätzbar
- Eignung: keine unabhängigen Daten
Speicherbedarf
- Bedarf je Gerät
- 10,2 bis 12,5 GiB
- Verfügbar je Gerät
- 43,2 GiB
Antwortgeschwindigkeit
Eignung für Ihre Aufgabe
Für DeepSeek-R1-0528-Qwen3-8B liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.
Der Katalog nennt 8,2 Milliarden Parameter, 32.768 Tokens Kontextlänge und das Anlagedatum 29.05.2025. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.
Modellkarte von DeepSeek-R1-0528-Qwen3-8B beim Herausgeber öffnen
Offene Punkte
Info
- Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
Warum diese Einschätzung
DeepSeek-R1-0528-Qwen3-8B
Repository angelegt am 29.05.2025 huggingface.co / DeepSeek-R1-0528-Qwen3-8B
- Speicher reicht rechnerisch, 27,1 GiB bleiben frei
- Geschwindigkeit nicht schätzbar
- Eignung: keine unabhängigen Daten
Speicherbedarf
- Bedarf je Gerät
- 13,6 bis 16,1 GiB
- Verfügbar je Gerät
- 43,2 GiB
Antwortgeschwindigkeit
Eignung für Ihre Aufgabe
Für DeepSeek-R1-0528-Qwen3-8B liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.
Der Katalog nennt 8,2 Milliarden Parameter, 32.768 Tokens Kontextlänge und das Anlagedatum 29.05.2025. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.
Modellkarte von DeepSeek-R1-0528-Qwen3-8B beim Herausgeber öffnen
Offene Punkte
Info
- Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
Warum diese Einschätzung
Test mit Ihren eigenen AufgabenDie Liste zeigt Rechenwerte. Ob ein Modell Ihre Aufgaben löst, zeigt erst ein Test mit Ihren eigenen Daten.
DeepSeek-R1-0528-Qwen3-8B
Repository angelegt am 29.05.2025 huggingface.co / DeepSeek-R1-0528-Qwen3-8B
- Speicher reicht rechnerisch, 19,8 GiB bleiben frei
- Geschwindigkeit nicht schätzbar
- Eignung: keine unabhängigen Daten
Speicherbedarf
- Bedarf je Gerät
- 20,8 bis 23,4 GiB
- Verfügbar je Gerät
- 43,2 GiB
Antwortgeschwindigkeit
Der Effizienzkorridor der Schätzung stammt aus einer Messreihe zu llama.cpp. Für andere Runtimes ist er nicht geprüft.Mit vLLM, unter Last oder mit Multi-Token-Prediction können reale Werte deutlich abweichen.Eignung für Ihre Aufgabe
Für DeepSeek-R1-0528-Qwen3-8B liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.
Der Katalog nennt 8,2 Milliarden Parameter, 32.768 Tokens Kontextlänge und das Anlagedatum 29.05.2025. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.
Modellkarte von DeepSeek-R1-0528-Qwen3-8B beim Herausgeber öffnen
Offene Punkte
Info
- Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
Warum diese Einschätzung
Qwen3-8B
Repository angelegt am 27.04.2025 huggingface.co / Qwen3-8B
- Speicher reicht rechnerisch, 30,7 GiB bleiben frei
- Geschwindigkeit nicht schätzbar
- Eignung: nur Herstellerangaben
Speicherbedarf
- Bedarf je Gerät
- 10,2 bis 12,5 GiB
- Verfügbar je Gerät
- 43,2 GiB
Antwortgeschwindigkeit
Eignung für Ihre Aufgabe
HerstellerangabeLiveCodeBench v5 (2024.10–2025.02) / thinking: 57,5 %
Angabe für die Modellvariante. Für diese Quantisierung liegt keine Messung vor.Thinking-Modus. Bis zu acht Versuche je Aufgabe. Die Quelle nennt keine Pass@8-Metrik. Herstellerangabe vom Mai 2025.Qwen Team, Qwen3 Technical Report (arXiv:2505.09388) · 14.05.2025Offene Punkte
Info
- Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
Warum diese Einschätzung
20 von 1.092 angezeigt
Wie Sie ein Coding-LLM testen
Für Coding zählt, ob erzeugte Änderungen im eigenen Repository funktionieren. Die Modellgröße allein beantwortet das nicht. Stellen Sie Aufgaben aus Ihren Sprachen, Frameworks und vorhandenen Tests zusammen.
Der Rechner startet ohne festgelegtes Gerät mit einem hypothetischen CUDA-Profil von 48 GiB, 32.768 Tokens Kontext und einer Anfrage. Der Kontext soll Platz für Code und Aufgabenbeschreibung vorsehen. Passen Sie ihn an Ihre tatsächlichen Eingaben an.
Bewerten Sie Fehlerkorrekturen, Erweiterungen und das Verständnis vorhandenen Codes getrennt. Führen Sie Tests in einer isolierten Umgebung aus. Halten Sie fest, ob ein Patch kompiliert, Tests besteht und die Aufgabe vollständig löst.
Werkzeugaufrufe sind eine eigene Anforderung. Wenn Ihr Workflow Dateien liest, Tests startet oder Änderungen anwendet, aktivieren Sie die Werkzeugoption und prüfen Sie Modellvorlage und Runtime-Unterstützung. Messen Sie danach den vollständigen Ablauf statt nur die Generierung.
Modellinformationen
Der Katalog zeigt Parameter, Kontextlänge, Lizenz und Quelle. Ein Eintrag bestätigt nicht, dass das Modell auf Ihrer Hardware läuft.
Der Katalog führt 1.081 Modelle mit technischen Daten, 3.958 weitere nur namentlich und 1.154 Formatfassungen dieser Modelle. Die Suche findet alle drei.
Verzeichnis der Herausgeber
Der Finder liest die Modellkonten der Herausgeber vollständig. Diese Übersicht zeigt je Konto, wie viele Modelle er mit Daten rechnet und wie viele er bisher nur führt. Die einzelnen Namen finden Sie über die Suche darüber.
1.081 Modelle mit Daten, 3.958 weitere nur geführt, aus 53 Herausgeberkonten.
Für die nur geführten Modelle holt der nächste Abgleichlauf die technischen Daten. Bis dahin finden Sie den Namen über die Suche und das Modell über den Link auf das Konto.
Dazu kommen 1.154 Formatfassungen. Das ist dasselbe Modell als GGUF, MLX, FP8, NVFP4, AWQ oder GPTQ. Der Finder rechnet sie als Konfiguration des Originals und führt ihren Namen, damit die Suche ihn findet.
| Herausgeber | Mit Daten | Nur geführt | Formatfassungen |
|---|---|---|---|
| 01-ai | 6 | 22 | 0 |
| ai21labs | 11 | 1 | 4 |
| Aleph-Alpha | 7 | 13 | 3 |
| allenai | 25 | 792 | 20 |
| apple | 5 | 49 | 2 |
| arcee-ai | 20 | 101 | 59 |
| baichuan-inc | 5 | 8 | 5 |
| baidu | 14 | 3 | 1 |
| ByteDance-Seed | 12 | 28 | 2 |
| CohereLabs | 16 | 14 | 12 |
| deepseek-ai | 68 | 48 | 0 |
| 66 | 749 | 37 | |
| HuggingFaceTB | 22 | 34 | 10 |
| ibm-granite | 56 | 75 | 60 |
| IFM | 12 | 14 | 9 |
| inclusionAI | 23 | 118 | 37 |
| internlm | 9 | 69 | 29 |
| JetBrains | 3 | 11 | 16 |
| kakaocorp | 14 | 2 | 0 |
| LGAI-EXAONE | 13 | 9 | 28 |
| LiquidAI | 16 | 23 | 106 |
| llm-jp | 7 | 242 | 3 |
| meta-llama | 62 | 30 | 7 |
| microsoft | 83 | 234 | 29 |
| MiniMaxAI | 16 | 7 | 0 |
| mistralai | 33 | 17 | 16 |
| moonshotai | 16 | 0 | 0 |
| naver-hyperclovax | 4 | 2 | 0 |
| NousResearch | 17 | 75 | 33 |
| nvidia | 29 | 423 | 111 |
| occiglot | 10 | 0 | 0 |
| openai | 5 | 13 | 0 |
| openbmb | 22 | 68 | 61 |
| openGPT-X | 3 | 0 | 0 |
| OpenGVLab | 4 | 181 | 23 |
| PleIAs | 12 | 7 | 5 |
| Qwen | 86 | 111 | 239 |
| rinna | 4 | 26 | 27 |
| Salesforce | 10 | 104 | 5 |
| sarvamai | 5 | 2 | 6 |
| ServiceNow-AI | 7 | 1 | 1 |
| Skywork | 13 | 20 | 5 |
| stabilityai | 16 | 21 | 3 |
| stepfun-ai | 14 | 10 | 8 |
| swiss-ai | 13 | 0 | 9 |
| tencent | 30 | 33 | 38 |
| tiiuae | 27 | 26 | 59 |
| trillionlabs | 8 | 17 | 2 |
| upstage | 16 | 7 | 1 |
| utter-project | 20 | 16 | 0 |
| xai-org | 2 | 0 | 0 |
| XiaomiMiMo | 9 | 6 | 1 |
| zai-org | 55 | 76 | 22 |
Offener Katalog zum Abruf
Der Bestand, aus dem diese Seite rechnet, steht als offene Schnittstelle bereit. Jede Beobachtung nennt ihre Quelle, deren Lizenz und das Datum der Erhebung. Die Antworten sind JSON und seitenweise abrufbar, ein Zugang ist nicht nötig.
- Kopfsatz mit Stand, Zahlen je Sammlung und Nutzungshinweis/wp-json/torck-llm/v1/catalog
- Einträge einer Sammlung mit ihren geltenden Werten/wp-json/torck-llm/v1/catalog/entities?kind=ModelVariant
- Einzelwerte mit Herkunft, Quelle, Datum und Einheit/wp-json/torck-llm/v1/catalog/values
- Quellen mit Lizenz, Status und Nutzungsbedingungen/wp-json/torck-llm/v1/catalog/sources
- Änderungen seit einem früheren Stand/wp-json/torck-llm/v1/catalog/changes?since=0
Ausgegeben wird nur, was die jeweilige Quelle zur Weitergabe mit Quellenangabe freigibt. Die Bedingungen der Quelle gelten auch für jede Weiterverwendung. Die Ausschlussregel steht im Kopfsatz. Datenstand .
Quellen und Lizenzen
Der Finder übernimmt einzelne Angaben aus diesen Quellen und rechnet sie in Speicher- und Eignungsangaben um. Die Quellen haben diese Auswertung nicht geprüft.
- AMD
Keine Lizenz für die Daten angegeben · Einzelangaben mit Quellenverweis · Abgerufen am 20.09.2026 · Quelldokumente: 15 - Apple
Keine Lizenz für die Daten angegeben · Einzelangaben mit Quellenverweis · Abgerufen am 17.09.2026 · Quelldokumente: 21 - heise online, Jan-Keno Janssen
Keine Lizenz für die Daten angegeben · Einzelangaben mit Quellenverweis · Abgerufen am 17.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste 01-ai
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste ai21labs
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste Aleph-Alpha
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste allenai
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste apple
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste arcee-ai
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste baichuan-inc
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste baidu
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste ByteDance-Seed
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste CohereLabs
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste deepseek-ai
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste google
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste HuggingFaceTB
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste ibm-granite
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste IFM
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste inclusionAI
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste internlm
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste JetBrains
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste kakaocorp
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste LGAI-EXAONE
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste LiquidAI
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste llm-jp
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste meta-llama
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste microsoft
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste MiniMaxAI
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste mistralai
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste moonshotai
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste naver-hyperclovax
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste NousResearch
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste nvidia
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste occiglot
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste openai
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste openbmb
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste openGPT-X
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste OpenGVLab
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste PleIAs
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste Qwen
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste rinna
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste Salesforce
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste sarvamai
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste ServiceNow-AI
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste Skywork
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste stabilityai
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste stepfun-ai
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste swiss-ai
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste tencent
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste tiiuae
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste trillionlabs
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste upstage
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste utter-project
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste xai-org
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste XiaomiMiMo
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face, Modellliste zai-org
Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - Hugging Face Hub
Lizenz: Apache 2.0; Eigene Lizenz des Herausgebers (Text in der Quelle); Gemma-Nutzungsbedingungen; Llama 3 Community License; Llama 3.1 Community License; Llama 3.2 Community License; Llama 3.3 Community License; MIT; MIT mit Bedingungen des Llama-Basismodells · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 3970 - Intel
Keine Lizenz für die Daten angegeben · Einzelangaben mit Quellenverweis · Abgerufen am 17.09.2026 · Quelldokumente: 7 - Knoop, Holtmann (arXiv:2601.09527)
Keine Lizenz für die Daten angegeben · Einzelangaben mit Quellenverweis · Abgerufen am 17.09.2026 · Quelldokumente: 1 - llama-roofline, Manu Nicholas Jacob
Lizenz: MIT · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 17.09.2026 · Quelldokumente: 1 - llama.cpp, The ggml authors
Lizenz: MIT · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 10 - Max Vyaznikov, GPU Ark (Zenodo, doi:10.5281/zenodo.20390790)
Lizenz: CC BY 4.0 · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 17.09.2026 · Quelldokumente: 1 - Meta Llama
Keine Lizenz für die Daten angegeben · Einzelangaben mit Quellenverweis · Abgerufen am 17.09.2026 · Quelldokumente: 2 - MLX, MLX Contributors
Lizenz: MIT · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 17.09.2026 · Quelldokumente: 1 - mlx-lm, Apple Inc.
Lizenz: MIT · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1 - mlx-lm, MLX Contributors
Lizenz: MIT · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 17.09.2026 · Quelldokumente: 1 - NVIDIA
Keine Lizenz für die Daten angegeben · Einzelangaben mit Quellenverweis · Abgerufen am 20.09.2026 · Quelldokumente: 27 - Qwen Team, Qwen3 Technical Report (arXiv:2505.09388)
Keine Lizenz für die Daten angegeben · Einzelangaben mit Quellenverweis · Abgerufen am 17.09.2026 · Quelldokumente: 1 - Qwen Team
Keine Lizenz für die Daten angegeben · Einzelangaben mit Quellenverweis · Abgerufen am 17.09.2026 · Quelldokumente: 1 - vLLM project
Lizenz: Apache 2.0 · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 10
Berechnungsmethode
Die Speicherrechnung folgt der Methode memory-envelope-v1: weights + 2*layers*kv_heads*head_dim*kv_bytes*context*concurrency + workspace
Der KV-Cache bekommt 5 % Zuschlag für die Speicherverwaltung, die Dateigröße der Gewichte 3 %. Für den Arbeitsspeicher der Runtime sind 1,0 bis 3,0 GiB angesetzt. Vom Gerätespeicher bleiben 10 % als Reserve frei.
Die Annahmen stützen sich auf die vLLM-Dokumentation zur Speicheroptimierung und sind eine Planungsannahme von torck, erfasst am .
Rechenbeispiel für Devstral-Small-2-24B-Instruct-2512 in Q4_K_M auf Planungsprofil CUDA · 48 GiB mit 32.768 Tokens Kontext und gleichzeitigen Anfragen 1. Gewichte 13,3 bis 13,8 GiB, KV-Cache 5,0 bis 5,3 GiB, Arbeitsspeicher der Runtime 1,0 bis 3,0 GiB. Zusammen sind das 19,3 bis 22,0 GiB. Nutzbar sind 43,2 GiB.
Berechenbar heißt: Für die Modellvariante gibt es mindestens eine Konfiguration mit belegter Dateigröße. Das gilt für 400 von 1.081 Modellvarianten im Katalog. Die übrigen führt der Katalog mit technischen Daten, aber noch ohne rechenbare Konfiguration.
Der Speicherbedarf ist berechnet, nicht gemessen. Er setzt sich aus den Modellgewichten nach Dateigröße oder Bitbreite der Quantisierung, dem KV-Cache für Kontext und gleichzeitige Anfragen und dem Arbeitsspeicher der Runtime zusammen. Die Reserve bleibt frei.
Die Antwortgeschwindigkeit ist geschätzt, nicht gemessen. Die Obergrenze ist die Speicherbandbreite des Geräts geteilt durch die Bytes, die je erzeugtem Token gelesen werden. Das sind die aktiven Parameter mal Bytes je Gewicht plus der KV-Cache. Angezeigt wird eine Spanne von 60 bis 80 Prozent dieser Obergrenze. Dieser Korridor ist eine Faustregel, keine Genauigkeitszusage. Eine Zahl erscheint nur für CUDA und Metal, für eine einzelne Anfrage und für Modelle, die vollständig im Gerätespeicher liegen.
Für Runtime und Gerät nennt jede Konfiguration eine Nachweisstufe, etwa „Offiziell gebaut“ oder „Zielarchitektur im offiziellen Build“. Eine Nachweisstufe ist keine Aussage über Geschwindigkeit oder fehlerfreie Ausgabe. Fehlt ein Nachweis, steht der Grund bei den offenen Punkten.
Bei MoE-Modellen kann die Rechnung deutlich zu hoch liegen. Langer Kontext, Backend, Treiber und Build, mehrere gleichzeitige Anfragen, vLLM unter Last und Offload verändern die reale Rate. Für ROCm und SYCL zeigt der Finder keine Zahl, weil keine geprüfte Vergleichsmessung vorliegt. Die Verarbeitung des Prompts vor der ersten Antwort ist nicht eingerechnet.