Welche lokalen LLMs für Coding infrage kommen

Nach dem Datenstand vom reicht der Speicher von Planungsprofil CUDA · 48 GiB rechnerisch für 126 von 1.092 erfassten Konfigurationen, davon 0 knapp. Annahmen: 32.768 Tokens Kontext, gleichzeitige Anfragen 1, Reserve 10 %. Nutzbar bleiben 43,2 GiB. Für 757 Konfigurationen fehlt noch ein vollständiger Speicherwert.

Erster Testkandidat ist Devstral-Small-2-24B-Instruct-2512 in Q4_K_M mit llama.cpp. Diese Konfiguration braucht bis 22,0 GiB, eine Tempo-Schätzung gibt es für dieses Gerät nicht. Runtime-Stand llama.cpp: Build b10964 vom 14.09.2026 (Quelle). Eignung: keine unabhängigen Daten. Speicher und Tempo sind gerechnet, nicht gemessen. Die Eignung für Ihre Aufgabe zeigt erst ein Test mit eigenen Fragen.

torck LLM Finder

Ihre Anforderungen

400 berechenbare Modelle · 1.092 Konfigurationen · 93 Hardwareoptionen · Datenstand

Direkt zum Ergebnis

Einstieg

Ihre Hardware steht fest. Der Finder prüft passende Modellkonfigurationen auf diesem Gerät.

Ihr Modell steht fest. Der Finder prüft, auf welcher erfassten Hardware es unter diesen Angaben läuft.

Sie beschreiben Aufgabe und Anforderungen. Der Finder filtert Konfigurationen nach diesen Angaben.

Wählen Sie zwei bis vier Konfigurationen für den direkten Vergleich.

Bis zu vier Konfigurationen auswählen

Suchen Sie nach Modell, Quantisierung oder Laufzeit. 1.092 Konfigurationen stehen zur Auswahl.

Noch nichts gewählt. Suchen Sie oben nach einem Modell, um Konfigurationen zu vergleichen.

Die Aufgabe legt die Richtgröße für die Geschwindigkeit in der Auswahl fest. Bei Agenten prüft der Finder zusätzlich die Unterstützung externer Werkzeuge. Nach Antwortqualität filtert die Aufgabe nicht.

Hardware noch offen: mit einem Planungsprofil von 48 GiB starten

Weitere 681 Modelle stehen im Katalog und werden nicht berechnet: 402 ohne quantisierte Fassung bei einem zugelassenen Konto, 254 Grund nicht hinterlegt, 20 keine Sprachmodellauswahl, 5 Formatfassung eines anderen Modells. Zur Modellübersicht
Tokens pro Anfrage, einschließlich Eingabe, Verlauf und geplanter Ausgabe.
Anzahl der Anfragen, die gleichzeitig verarbeitet werden.
Weitere Einstellungen
Fehlende Lizenzinformationen werden als ungeklärt angezeigt.
Wählen Sie eine Sprache. Fehlt ein unabhängiger Test, bleibt die Eignung ungeklärt.
Die Runtime führt das Modell aus. Version, Format und Hardware müssen zusammenpassen.
Die Quantisierung legt fest, wie viele Bits pro Modellwert gespeichert werden. Sie beeinflusst den Speicherbedarf und kann die Qualität beeinflussen.

Workspace ist zusätzlicher Arbeitsspeicher für Zwischenergebnisse und die Runtime. Die angegebene Spanne ist geschätzt. Sie hängt davon ab, wie viele Tokens gemeinsam verarbeitet werden und welche Runtime Sie verwenden. Speicher für Bildverarbeitung kommt gegebenenfalls hinzu.

Der KV-Cache speichert Zwischenstände laufender Anfragen. Kontextlänge und Zahl gleichzeitiger Anfragen erhöhen seinen Speicherbedarf.

GPU-Speicher und CPU-RAM können je nach Konfiguration gemeinsam genutzt werden. Die tatsächliche Verteilung kann abweichen.

Ergebnisse 1092

20 von 1.092 Ergebnissen, Seite 1 von 55.

Berechneter Speicherbedarf: Speicher reicht rechnerisch: 126 · An der Speichergrenze: 3 · Speicherbedarf noch offen: 757 · Benötigt mehr Speicher: 206 · Datenstand

Was die Zeichen bedeuten

  • in Ordnung: Der Speicher reicht rechnerisch, oder die Zahl daneben ist gemessen.
  • mit Vorbehalt: Reicht knapp, liegt an der Speichergrenze oder braucht CPU-Offload. Der Satz daneben nennt den Fall.
  • nicht möglich: Es fehlt Speicher, oder Laufzeit und Hardware passen nicht zusammen.
  • offen: Eine Angabe fehlt im Datenstand, der Wert ist nicht zu berechnen.
  • geschätzt: Gerechnet, nicht gemessen.
  • belegt: Gemessen, Quelle und Herkunft stehen in den Einzelheiten.

Modelle für den ersten Test

Richtgröße für diese Aufgabe: 10 Tokens pro Sekunde. Das ist eine Annahme von torck, eine belegte Schwelle gibt es dafür nicht.

  • Erster Testkandidat

    Devstral-Small-2-24B-Instruct-2512
    Quantisierung
    Q4_K_M
    Runtime
    llama.cpp

    Repository angelegt am 28.11.2025 huggingface.co / Devstral-Small-2-24B-Instruct-2512

    • Speicher reicht rechnerisch, 21,2 GiB bleiben frei
    • Geschwindigkeit nicht schätzbar
    • Eignung: keine unabhängigen Daten

    Passt mit Reserve in den Speicher. Geschwindigkeit nicht geschätzt. Gereiht wurde nach Größe, soweit sie ausreicht, danach nach Aktualität und Beleglage. Prüfen Sie die Eignung mit 20 eigenen Aufgaben aus Ihrem Code und lassen Sie Ihre Tests darüber laufen.

    Speicherbedarf
    Bedarf je Gerät
    19,3 bis 22,0 GiB
    Verfügbar je Gerät
    43,2 GiB
    Antwortgeschwindigkeit
    Eignung für Ihre Aufgabe

    Für Devstral-Small-2-24B-Instruct-2512 liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.

    Der Katalog nennt 24,0 Milliarden Parameter, 262.144 Tokens Kontextlänge und das Anlagedatum 28.11.2025. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.

    Modellkarte von Devstral-Small-2-24B-Instruct-2512 beim Herausgeber öffnen

    Eignung selbst testen

    Offene Punkte

    Info

    • Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
  • Nächster Platz der Rangfolge

    Magistral-Small-2509
    Quantisierung
    Q4_K_M
    Runtime
    llama.cpp

    Repository angelegt am 12.09.2025 huggingface.co / Magistral-Small-2509

    • Speicher reicht rechnerisch, 21,2 GiB bleiben frei
    • Geschwindigkeit nicht schätzbar
    • Eignung: keine unabhängigen Daten

    Steht in der Rangfolge direkt hinter dem ersten Testkandidaten. Über die Antwortqualität sagt der Platz nichts.

    Speicherbedarf
    Bedarf je Gerät
    19,3 bis 22,0 GiB
    Verfügbar je Gerät
    43,2 GiB
    Antwortgeschwindigkeit
    Eignung für Ihre Aufgabe

    Für Magistral-Small-2509 liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.

    Der Katalog nennt 24,0 Milliarden Parameter, 131.072 Tokens Kontextlänge und das Anlagedatum 12.09.2025. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.

    Modellkarte von Magistral-Small-2509 beim Herausgeber öffnen

    Eignung selbst testen

    Offene Punkte

    Info

    • Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
  • Nächster Platz der Rangfolge

    Mistral-Small-3.2-24B-Instruct-2506
    Quantisierung
    Q4_K_M
    Runtime
    llama.cpp

    Repository angelegt am 19.06.2025 huggingface.co / Mistral-Small-3.2-24B-Instruct-2506

    • Speicher reicht rechnerisch, 21,2 GiB bleiben frei
    • Geschwindigkeit nicht schätzbar
    • Eignung: nur Herstellerangaben

    Steht in der Rangfolge direkt hinter dem ersten Testkandidaten. Über die Antwortqualität sagt der Platz nichts.

    Speicherbedarf
    Bedarf je Gerät
    19,3 bis 22,0 GiB
    Verfügbar je Gerät
    43,2 GiB
    Antwortgeschwindigkeit
    Eignung für Ihre Aufgabe
    Herstellerangabe

    HumanEval Plus: 92,9 %

    Angabe für die Modellvariante. Für diese Quantisierung liegt keine Messung vor.Herstellerangabe zu HumanEval Plus mit bis zu fünf Versuchen (Pass@5). Nicht mit Ergebnissen für einen einzelnen Versuch vergleichbar.Hugging Face Hub · 20.06.2025

    Eignung selbst testen

    Offene Punkte

    Info

    • Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.

Die Liste ist durchgehend nach derselben Rangfolge sortiert. Zuerst stehen Konfigurationen, für die geprüfte Daten vorliegen. Dann zählt, ob die geschätzte Mindestgeschwindigkeit beim gewählten Kontext die Richtgröße für Ihre Aufgabe erreicht. Danach gewinnt die größere Größenklasse, innerhalb einer Größenklasse das Modell mit dem jüngeren Anlagedatum des Repositorys, dann die höhere Parameterzahl, zuletzt der freie Speicher und geprüfte Laufzeitangaben. Über die Antwortqualität sagt die Reihenfolge nichts.

Entscheidungsvorlage und Testplan

Entscheidungsvorlage und Testplan

Datenstand: 19.09.2026

Kontext: 32.768 Tokens. Gleichzeitige Anfragen: 1. Reserve: 10 %.

Diese Auswahl liefert Kandidaten für einen Praxistest. Speicher und Tempo sind Schätzungen. Die Rangfolge belegt keine fachliche Qualität oder Freigabe für den Produktivbetrieb.

Einstieg
Ich habe einen Anwendungsfall
Aufgabe
Coding
Sprache der Anwendung
Keine Vorgabe
Anzahl identischer Geräte
1
Verteilung
Ein Gerät
KV-Cache: Bits pro Wert
16
KV-Cache: Speicherort
GPU / Unified Memory
Zusatzspeicher (Workspace), Minimum je Gerät in GiB
1
Zusatzspeicher (Workspace), Maximum je Gerät in GiB
3
Host-RAM (GiB)
64
CPU-Offload berücksichtigen
Nein
Bilder und gescannte Dokumente verarbeiten
Nein
Externe Werkzeuge aufrufen
Nein
Für geschäftliche Nutzung
Nein
Unabhängige Tests für die gewählte Sprache
Nein

Rechenweg: Speicher nach memory-envelope-v1, Rangfolge nach shortlist-rank-v3.

Devstral-Small-2-24B-Instruct-2512

Planungsprofil CUDA · 48 GiB · Q4_K_M · llama.cpp b10964

Passt mit Reserve in den Speicher. Geschwindigkeit nicht geschätzt. Gereiht wurde nach Größe, soweit sie ausreicht, danach nach Aktualität und Beleglage. Prüfen Sie die Eignung mit 20 eigenen Aufgaben aus Ihrem Code und lassen Sie Ihre Tests darüber laufen.

  • Speicher reicht rechnerisch, 21,2 GiB bleiben frei
  • Geschwindigkeit nicht schätzbar
  • Eignung: keine unabhängigen Daten

Bedarf je Gerät: 19,3 bis 22,0 GiB · Verfügbar je Gerät: 43,2 GiB

Keine belastbare Temposchätzung für diese Vorgaben. Messen Sie Antwortbeginn und Generierung mit dem geplanten Kontext und parallelen Anfragen.

Vor dem Pilot klären
  • Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.

Starten Sie die genannte Konfiguration auf dem Zielgerät. Protokollieren Sie Modellrevision, Runtime-Version, Speichermaximum und Laufzeitfehler.

Magistral-Small-2509

Planungsprofil CUDA · 48 GiB · Q4_K_M · llama.cpp b10964

Steht in der Rangfolge direkt hinter dem ersten Testkandidaten. Über die Antwortqualität sagt der Platz nichts.

  • Speicher reicht rechnerisch, 21,2 GiB bleiben frei
  • Geschwindigkeit nicht schätzbar
  • Eignung: keine unabhängigen Daten

Bedarf je Gerät: 19,3 bis 22,0 GiB · Verfügbar je Gerät: 43,2 GiB

Keine belastbare Temposchätzung für diese Vorgaben. Messen Sie Antwortbeginn und Generierung mit dem geplanten Kontext und parallelen Anfragen.

Vor dem Pilot klären
  • Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.

Starten Sie die genannte Konfiguration auf dem Zielgerät. Protokollieren Sie Modellrevision, Runtime-Version, Speichermaximum und Laufzeitfehler.

Mistral-Small-3.2-24B-Instruct-2506

Planungsprofil CUDA · 48 GiB · Q4_K_M · llama.cpp b10964

Steht in der Rangfolge direkt hinter dem ersten Testkandidaten. Über die Antwortqualität sagt der Platz nichts.

  • Speicher reicht rechnerisch, 21,2 GiB bleiben frei
  • Geschwindigkeit nicht schätzbar
  • Eignung: nur Herstellerangaben

Bedarf je Gerät: 19,3 bis 22,0 GiB · Verfügbar je Gerät: 43,2 GiB

Keine belastbare Temposchätzung für diese Vorgaben. Messen Sie Antwortbeginn und Generierung mit dem geplanten Kontext und parallelen Anfragen.

Vor dem Pilot klären
  • Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.

Starten Sie die genannte Konfiguration auf dem Zielgerät. Protokollieren Sie Modellrevision, Runtime-Version, Speichermaximum und Laufzeitfehler.

Abnahme mit eigenen Aufgaben

Für Coding zählt, ob erzeugter Code Ihre Tests besteht. Lassen Sie das Modell Aufgaben aus Ihrem eigenen Code lösen und führen Sie Ihre vorhandenen Tests auf dem Ergebnis aus. Maßstab ist der Anteil bestandener Tests.

Vorschlag für den Pilot: 20 typische Fälle mit vorab festgelegten Sollantworten, darunter Fehlerfälle und Fragen ohne belegbare Antwort. Nutzen Sie für alle Kandidaten dieselben Prompts und Dokumente. Legen Sie vor dem Test Mindestqualität und maximale Wartezeit fest. Erfassen Sie pro Fall die fachliche Bewertung, Quellenfehler, Antwortbeginn und Gesamtdauer. Wiederholen Sie den Lauf unter geplanter Parallelität.

Der Ergebnislink öffnet die Rechnung mit diesen Annahmen und den Quellen. Der Katalog wird aktualisiert, spätere Ergebnisse können abweichen. Für eine nachvollziehbare Ablage speichern Sie zusätzlich den JSON-Export mit den Quellen und dem Datenstand.

Lokaler Betrieb und API: eigene Kostenrechnung

Alle Beträge sind eigene Annahmen in EUR netto. Die Felder bleiben auf diesem Gerät. Beim Herunterladen der Entscheidungsvorlage werden sie in die Datei aufgenommen. Tragen Sie für nicht anfallende Kosten 0 ein. Vergleichen Sie nur Angebote mit der benötigten Qualität, Verfügbarkeit und Datenverarbeitung.

Lokal pro Monat = Anschaffung ÷ Nutzungsdauer + W ÷ 1000 × Stunden × Strompreis + Betrieb. API pro Monat = Anfragen × (Input-Tokens × Inputpreis + Output-Tokens × Outputpreis) ÷ 1.000.000. Zusatzkosten wie Retrieval, Speicher, Ausfallsicherung und API-Grundgebühren separat berücksichtigen. Die Rechnung prüft weder Kapazität noch vergleichbare Antwortqualität.

Für den Vergleich alle Felder mit gültigen Werten ausfüllen.

Gilt für alle Ergebnisse

Kontext: 32.768 Tokens. Gleichzeitige Anfragen: 1. Reserve: 10 %.

Die Geschwindigkeit ist geschätzt. Ob ein Modell Ihre Aufgaben gut löst, zeigt erst ein Test mit eigenen Beispielen. Der Speicherbedarf ist berechnet, nicht gemessen. Die Lizenzinformationen ersetzen keine rechtliche Prüfung für Ihren Einsatz.

Eignung für Ihre Aufgabe selbst testen

Für Coding zählt, ob erzeugter Code Ihre Tests besteht. Lassen Sie das Modell Aufgaben aus Ihrem eigenen Code lösen und führen Sie Ihre vorhandenen Tests auf dem Ergebnis aus. Maßstab ist der Anteil bestandener Tests.

So rechnet der Finder

Wer selbst misst, liest den Wert in der Zeile tg128 von llama-bench. Das ist die Antwortgeschwindigkeit in Tokens pro Sekunde.

Für diese Hardware liegt keine belegte Speicherbandbreite vor.

Zum Messen führen Sie llama-bench mit Ihrer Modelldatei aus. Anleitung zu llama-bench

„Offiziell gebaut“ ist keine Aussage über Geschwindigkeit oder fehlerfreie Ausgabe.

Alle 1.092 Konfigurationen

  • Devstral-Small-2-24B-Instruct-2512
    Quantisierung
    Q4_K_M
    Runtime
    llama.cpp

    Repository angelegt am 28.11.2025 huggingface.co / Devstral-Small-2-24B-Instruct-2512

    • Speicher reicht rechnerisch, 21,2 GiB bleiben frei
    • Geschwindigkeit nicht schätzbar
    • Eignung: keine unabhängigen Daten
    Speicherbedarf
    Bedarf je Gerät
    19,3 bis 22,0 GiB
    Verfügbar je Gerät
    43,2 GiB
    Antwortgeschwindigkeit
    Eignung für Ihre Aufgabe

    Für Devstral-Small-2-24B-Instruct-2512 liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.

    Der Katalog nennt 24,0 Milliarden Parameter, 262.144 Tokens Kontextlänge und das Anlagedatum 28.11.2025. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.

    Modellkarte von Devstral-Small-2-24B-Instruct-2512 beim Herausgeber öffnen

    Eignung selbst testen

    Offene Punkte

    Info

    • Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
    Warum diese Einschätzung

    Rechenweg und Quellen anzeigen

  • Devstral-Small-2-24B-Instruct-2512
    Quantisierung
    Q8_0
    Runtime
    llama.cpp

    Repository angelegt am 28.11.2025 huggingface.co / Devstral-Small-2-24B-Instruct-2512

    • Speicher reicht rechnerisch, 10,9 GiB bleiben frei
    • Geschwindigkeit nicht schätzbar
    • Eignung: keine unabhängigen Daten
    Speicherbedarf
    Bedarf je Gerät
    29,3 bis 32,3 GiB
    Verfügbar je Gerät
    43,2 GiB
    Antwortgeschwindigkeit
    Eignung für Ihre Aufgabe

    Für Devstral-Small-2-24B-Instruct-2512 liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.

    Der Katalog nennt 24,0 Milliarden Parameter, 262.144 Tokens Kontextlänge und das Anlagedatum 28.11.2025. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.

    Modellkarte von Devstral-Small-2-24B-Instruct-2512 beim Herausgeber öffnen

    Eignung selbst testen

    Offene Punkte

    Info

    • Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
    Warum diese Einschätzung

    Rechenweg und Quellen anzeigen

  • Magistral-Small-2509
    Quantisierung
    Q4_K_M
    Runtime
    llama.cpp

    Repository angelegt am 12.09.2025 huggingface.co / Magistral-Small-2509

    • Speicher reicht rechnerisch, 21,2 GiB bleiben frei
    • Geschwindigkeit nicht schätzbar
    • Eignung: keine unabhängigen Daten
    Speicherbedarf
    Bedarf je Gerät
    19,3 bis 22,0 GiB
    Verfügbar je Gerät
    43,2 GiB
    Antwortgeschwindigkeit
    Eignung für Ihre Aufgabe

    Für Magistral-Small-2509 liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.

    Der Katalog nennt 24,0 Milliarden Parameter, 131.072 Tokens Kontextlänge und das Anlagedatum 12.09.2025. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.

    Modellkarte von Magistral-Small-2509 beim Herausgeber öffnen

    Eignung selbst testen

    Offene Punkte

    Info

    • Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
    Warum diese Einschätzung

    Rechenweg und Quellen anzeigen

  • Magistral-Small-2509
    Quantisierung
    Q8_0
    Runtime
    llama.cpp

    Repository angelegt am 12.09.2025 huggingface.co / Magistral-Small-2509

    • Speicher reicht rechnerisch, 10,9 GiB bleiben frei
    • Geschwindigkeit nicht schätzbar
    • Eignung: keine unabhängigen Daten
    Speicherbedarf
    Bedarf je Gerät
    29,3 bis 32,3 GiB
    Verfügbar je Gerät
    43,2 GiB
    Antwortgeschwindigkeit
    Eignung für Ihre Aufgabe

    Für Magistral-Small-2509 liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.

    Der Katalog nennt 24,0 Milliarden Parameter, 131.072 Tokens Kontextlänge und das Anlagedatum 12.09.2025. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.

    Modellkarte von Magistral-Small-2509 beim Herausgeber öffnen

    Eignung selbst testen

    Offene Punkte

    Info

    • Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
    Warum diese Einschätzung

    Rechenweg und Quellen anzeigen

  • Mistral-Small-3.2-24B-Instruct-2506
    Quantisierung
    Q4_K_M
    Runtime
    llama.cpp

    Repository angelegt am 19.06.2025 huggingface.co / Mistral-Small-3.2-24B-Instruct-2506

    • Speicher reicht rechnerisch, 21,2 GiB bleiben frei
    • Geschwindigkeit nicht schätzbar
    • Eignung: nur Herstellerangaben
    Speicherbedarf
    Bedarf je Gerät
    19,3 bis 22,0 GiB
    Verfügbar je Gerät
    43,2 GiB
    Antwortgeschwindigkeit
    Eignung für Ihre Aufgabe
    Herstellerangabe

    HumanEval Plus: 92,9 %

    Angabe für die Modellvariante. Für diese Quantisierung liegt keine Messung vor.Herstellerangabe zu HumanEval Plus mit bis zu fünf Versuchen (Pass@5). Nicht mit Ergebnissen für einen einzelnen Versuch vergleichbar.Hugging Face Hub · 20.06.2025

    Eignung selbst testen

    Offene Punkte

    Info

    • Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
    Warum diese Einschätzung

    Rechenweg und Quellen anzeigen

  • Mistral-Small-3.2-24B-Instruct-2506
    Quantisierung
    Q8_0
    Runtime
    llama.cpp

    Repository angelegt am 19.06.2025 huggingface.co / Mistral-Small-3.2-24B-Instruct-2506

    • Speicher reicht rechnerisch, 10,9 GiB bleiben frei
    • Geschwindigkeit nicht schätzbar
    • Eignung: nur Herstellerangaben
    Speicherbedarf
    Bedarf je Gerät
    29,3 bis 32,3 GiB
    Verfügbar je Gerät
    43,2 GiB
    Antwortgeschwindigkeit
    Eignung für Ihre Aufgabe
    Herstellerangabe

    HumanEval Plus: 92,9 %

    Angabe für die Modellvariante. Für diese Quantisierung liegt keine Messung vor.Herstellerangabe zu HumanEval Plus mit bis zu fünf Versuchen (Pass@5). Nicht mit Ergebnissen für einen einzelnen Versuch vergleichbar.Hugging Face Hub · 20.06.2025

    Eignung selbst testen

    Offene Punkte

    Info

    • Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
    Warum diese Einschätzung

    Rechenweg und Quellen anzeigen

  • Test mit Ihren eigenen AufgabenDie Liste zeigt Rechenwerte. Ob ein Modell Ihre Aufgaben löst, zeigt erst ein Test mit Ihren eigenen Daten.

    Test besprechen

  • Magistral-Small-2506
    Quantisierung
    Q4_K_M
    Runtime
    llama.cpp

    Repository angelegt am 04.06.2025 huggingface.co / Magistral-Small-2506

    • Speicher reicht rechnerisch, 21,2 GiB bleiben frei
    • Geschwindigkeit nicht schätzbar
    • Eignung: keine unabhängigen Daten
    Speicherbedarf
    Bedarf je Gerät
    19,3 bis 22,0 GiB
    Verfügbar je Gerät
    43,2 GiB
    Antwortgeschwindigkeit
    Eignung für Ihre Aufgabe

    Für Magistral-Small-2506 liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.

    Der Katalog nennt 23,6 Milliarden Parameter, 40.960 Tokens Kontextlänge und das Anlagedatum 04.06.2025. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.

    Modellkarte von Magistral-Small-2506 beim Herausgeber öffnen

    Eignung selbst testen

    Offene Punkte

    Info

    • Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
    Warum diese Einschätzung

    Rechenweg und Quellen anzeigen

  • Magistral-Small-2506
    Quantisierung
    Q8_0
    Runtime
    llama.cpp

    Repository angelegt am 04.06.2025 huggingface.co / Magistral-Small-2506

    • Speicher reicht rechnerisch, 10,9 GiB bleiben frei
    • Geschwindigkeit nicht schätzbar
    • Eignung: keine unabhängigen Daten
    Speicherbedarf
    Bedarf je Gerät
    29,3 bis 32,3 GiB
    Verfügbar je Gerät
    43,2 GiB
    Antwortgeschwindigkeit
    Eignung für Ihre Aufgabe

    Für Magistral-Small-2506 liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.

    Der Katalog nennt 23,6 Milliarden Parameter, 40.960 Tokens Kontextlänge und das Anlagedatum 04.06.2025. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.

    Modellkarte von Magistral-Small-2506 beim Herausgeber öffnen

    Eignung selbst testen

    Offene Punkte

    Info

    • Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
    Warum diese Einschätzung

    Rechenweg und Quellen anzeigen

  • Qwen3-32B
    Quantisierung
    AWQ 4bit
    Runtime
    vLLM

    Repository angelegt am 27.04.2025 huggingface.co / Qwen3-32B

    • Speicher reicht rechnerisch, 13,3 GiB bleiben frei
    • Geschwindigkeit nicht schätzbar
    • Eignung: keine unabhängigen Daten
    Speicherbedarf
    Bedarf je Gerät
    27,0 bis 29,9 GiB
    Verfügbar je Gerät
    43,2 GiB
    Antwortgeschwindigkeit
    Der Effizienzkorridor der Schätzung stammt aus einer Messreihe zu llama.cpp. Für andere Runtimes ist er nicht geprüft.Mit vLLM, unter Last oder mit Multi-Token-Prediction können reale Werte deutlich abweichen.
    Eignung für Ihre Aufgabe

    Für Qwen3-32B liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.

    Der Katalog nennt 32,8 Milliarden Parameter, 32.768 Tokens Kontextlänge und das Anlagedatum 27.04.2025. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.

    Modellkarte von Qwen3-32B beim Herausgeber öffnen

    Eignung selbst testen

    Offene Punkte

    Hinweis

    • Für diese Karte ist keine Rechenfähigkeit hinterlegt, deshalb bleibt offen, ob vLLM das Format darauf rechnet. Lesen Sie die Stufe mit nvidia-smi --query-gpu=compute_cap --format=csv aus und vergleichen Sie sie mit der Angabe der Quantisierung.

    Info

    • Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
    Warum diese Einschätzung

    Rechenweg und Quellen anzeigen

  • Qwen3-32B
    Quantisierung
    Q4_K_M
    Runtime
    llama.cpp

    Repository angelegt am 27.04.2025 huggingface.co / Qwen3-32B

    • Speicher reicht rechnerisch, 12,8 GiB bleiben frei
    • Geschwindigkeit nicht schätzbar
    • Eignung: keine unabhängigen Daten
    Speicherbedarf
    Bedarf je Gerät
    27,4 bis 30,4 GiB
    Verfügbar je Gerät
    43,2 GiB
    Antwortgeschwindigkeit
    Eignung für Ihre Aufgabe

    Für Qwen3-32B liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.

    Der Katalog nennt 32,8 Milliarden Parameter, 32.768 Tokens Kontextlänge und das Anlagedatum 27.04.2025. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.

    Modellkarte von Qwen3-32B beim Herausgeber öffnen

    Eignung selbst testen

    Offene Punkte

    Info

    • Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
    Warum diese Einschätzung

    Rechenweg und Quellen anzeigen

  • Qwen3-32B
    Quantisierung
    NVFP4
    Runtime
    vLLM

    Repository angelegt am 27.04.2025 huggingface.co / Qwen3-32B

    • Speicher reicht rechnerisch, 12,0 GiB bleiben frei
    • Geschwindigkeit nicht schätzbar
    • Eignung: keine unabhängigen Daten
    Speicherbedarf
    Bedarf je Gerät
    28,2 bis 31,2 GiB
    Verfügbar je Gerät
    43,2 GiB
    Antwortgeschwindigkeit
    Der Effizienzkorridor der Schätzung stammt aus einer Messreihe zu llama.cpp. Für andere Runtimes ist er nicht geprüft.Mit vLLM, unter Last oder mit Multi-Token-Prediction können reale Werte deutlich abweichen.
    Eignung für Ihre Aufgabe

    Für Qwen3-32B liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.

    Der Katalog nennt 32,8 Milliarden Parameter, 32.768 Tokens Kontextlänge und das Anlagedatum 27.04.2025. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.

    Modellkarte von Qwen3-32B beim Herausgeber öffnen

    Eignung selbst testen

    Offene Punkte

    Hinweis

    • Für diese Karte ist keine Rechenfähigkeit hinterlegt, deshalb bleibt offen, ob vLLM das Format darauf rechnet. Lesen Sie die Stufe mit nvidia-smi --query-gpu=compute_cap --format=csv aus und vergleichen Sie sie mit der Angabe der Quantisierung.

    Info

    • Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
    Warum diese Einschätzung

    Rechenweg und Quellen anzeigen

  • Mistral-Small-3.1-24B-Instruct-2503
    Quantisierung
    Q4_K_M
    Runtime
    llama.cpp

    Repository angelegt am 11.03.2025 huggingface.co / Mistral-Small-3.1-24B-Instruct-2503

    • Speicher reicht rechnerisch, 21,2 GiB bleiben frei
    • Geschwindigkeit nicht schätzbar
    • Eignung: keine unabhängigen Daten
    Speicherbedarf
    Bedarf je Gerät
    19,3 bis 22,0 GiB
    Verfügbar je Gerät
    43,2 GiB
    Antwortgeschwindigkeit
    Eignung für Ihre Aufgabe

    Für Mistral-Small-3.1-24B-Instruct-2503 liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.

    Der Katalog nennt 24,0 Milliarden Parameter, 131.072 Tokens Kontextlänge und das Anlagedatum 11.03.2025. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.

    Modellkarte von Mistral-Small-3.1-24B-Instruct-2503 beim Herausgeber öffnen

    Eignung selbst testen

    Offene Punkte

    Info

    • Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
    Warum diese Einschätzung

    Rechenweg und Quellen anzeigen

  • Test mit Ihren eigenen AufgabenDie Liste zeigt Rechenwerte. Ob ein Modell Ihre Aufgaben löst, zeigt erst ein Test mit Ihren eigenen Daten.

    Test besprechen

  • Mistral-Small-3.1-24B-Instruct-2503
    Quantisierung
    Q8_0
    Runtime
    llama.cpp

    Repository angelegt am 11.03.2025 huggingface.co / Mistral-Small-3.1-24B-Instruct-2503

    • Speicher reicht rechnerisch, 10,9 GiB bleiben frei
    • Geschwindigkeit nicht schätzbar
    • Eignung: keine unabhängigen Daten
    Speicherbedarf
    Bedarf je Gerät
    29,3 bis 32,3 GiB
    Verfügbar je Gerät
    43,2 GiB
    Antwortgeschwindigkeit
    Eignung für Ihre Aufgabe

    Für Mistral-Small-3.1-24B-Instruct-2503 liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.

    Der Katalog nennt 24,0 Milliarden Parameter, 131.072 Tokens Kontextlänge und das Anlagedatum 11.03.2025. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.

    Modellkarte von Mistral-Small-3.1-24B-Instruct-2503 beim Herausgeber öffnen

    Eignung selbst testen

    Offene Punkte

    Info

    • Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
    Warum diese Einschätzung

    Rechenweg und Quellen anzeigen

  • DeepSeek-R1-Distill-Qwen-32B
    Quantisierung
    Q4_K_M
    Runtime
    llama.cpp

    Repository angelegt am 20.01.2025 huggingface.co / DeepSeek-R1-Distill-Qwen-32B

    • Speicher reicht rechnerisch, 12,8 GiB bleiben frei
    • Geschwindigkeit nicht schätzbar
    • Eignung: keine unabhängigen Daten
    Speicherbedarf
    Bedarf je Gerät
    27,5 bis 30,4 GiB
    Verfügbar je Gerät
    43,2 GiB
    Antwortgeschwindigkeit
    Eignung für Ihre Aufgabe

    Für DeepSeek-R1-Distill-Qwen-32B liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.

    Der Katalog nennt 32,8 Milliarden Parameter, 131.072 Tokens Kontextlänge und das Anlagedatum 20.01.2025. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.

    Modellkarte von DeepSeek-R1-Distill-Qwen-32B beim Herausgeber öffnen

    Eignung selbst testen

    Offene Punkte

    Info

    • Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
    Warum diese Einschätzung

    Rechenweg und Quellen anzeigen

  • Codestral-22B-v0.1
    Quantisierung
    Q4_K_M
    Runtime
    llama.cpp

    Repository angelegt am 29.05.2024 huggingface.co / Codestral-22B-v0.1

    • Speicher reicht rechnerisch, 20,1 GiB bleiben frei
    • Geschwindigkeit nicht schätzbar
    • Eignung: keine unabhängigen Daten
    Speicherbedarf
    Bedarf je Gerät
    20,4 bis 23,1 GiB
    Verfügbar je Gerät
    43,2 GiB
    Antwortgeschwindigkeit
    Eignung für Ihre Aufgabe

    Für Codestral-22B-v0.1 liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.

    Der Katalog nennt 22,2 Milliarden Parameter, 32.768 Tokens Kontextlänge und das Anlagedatum 29.05.2024. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.

    Modellkarte von Codestral-22B-v0.1 beim Herausgeber öffnen

    Eignung selbst testen

    Offene Punkte

    Info

    • Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
    Warum diese Einschätzung

    Rechenweg und Quellen anzeigen

  • Codestral-22B-v0.1
    Quantisierung
    Q8_0
    Runtime
    llama.cpp

    Repository angelegt am 29.05.2024 huggingface.co / Codestral-22B-v0.1

    • Speicher reicht rechnerisch, 10,2 GiB bleiben frei
    • Geschwindigkeit nicht schätzbar
    • Eignung: keine unabhängigen Daten
    Speicherbedarf
    Bedarf je Gerät
    30,0 bis 33,0 GiB
    Verfügbar je Gerät
    43,2 GiB
    Antwortgeschwindigkeit
    Eignung für Ihre Aufgabe

    Für Codestral-22B-v0.1 liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.

    Der Katalog nennt 22,2 Milliarden Parameter, 32.768 Tokens Kontextlänge und das Anlagedatum 29.05.2024. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.

    Modellkarte von Codestral-22B-v0.1 beim Herausgeber öffnen

    Eignung selbst testen

    Offene Punkte

    Info

    • Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
    Warum diese Einschätzung

    Rechenweg und Quellen anzeigen

  • DeepSeek-R1-0528-Qwen3-8B
    Quantisierung
    Q4_K_M
    Runtime
    llama.cpp

    Repository angelegt am 29.05.2025 huggingface.co / DeepSeek-R1-0528-Qwen3-8B

    • Speicher reicht rechnerisch, 30,7 GiB bleiben frei
    • Geschwindigkeit nicht schätzbar
    • Eignung: keine unabhängigen Daten
    Speicherbedarf
    Bedarf je Gerät
    10,2 bis 12,5 GiB
    Verfügbar je Gerät
    43,2 GiB
    Antwortgeschwindigkeit
    Eignung für Ihre Aufgabe

    Für DeepSeek-R1-0528-Qwen3-8B liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.

    Der Katalog nennt 8,2 Milliarden Parameter, 32.768 Tokens Kontextlänge und das Anlagedatum 29.05.2025. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.

    Modellkarte von DeepSeek-R1-0528-Qwen3-8B beim Herausgeber öffnen

    Eignung selbst testen

    Offene Punkte

    Info

    • Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
    Warum diese Einschätzung

    Rechenweg und Quellen anzeigen

  • DeepSeek-R1-0528-Qwen3-8B
    Quantisierung
    Q8_0
    Runtime
    llama.cpp

    Repository angelegt am 29.05.2025 huggingface.co / DeepSeek-R1-0528-Qwen3-8B

    • Speicher reicht rechnerisch, 27,1 GiB bleiben frei
    • Geschwindigkeit nicht schätzbar
    • Eignung: keine unabhängigen Daten
    Speicherbedarf
    Bedarf je Gerät
    13,6 bis 16,1 GiB
    Verfügbar je Gerät
    43,2 GiB
    Antwortgeschwindigkeit
    Eignung für Ihre Aufgabe

    Für DeepSeek-R1-0528-Qwen3-8B liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.

    Der Katalog nennt 8,2 Milliarden Parameter, 32.768 Tokens Kontextlänge und das Anlagedatum 29.05.2025. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.

    Modellkarte von DeepSeek-R1-0528-Qwen3-8B beim Herausgeber öffnen

    Eignung selbst testen

    Offene Punkte

    Info

    • Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
    Warum diese Einschätzung

    Rechenweg und Quellen anzeigen

  • Test mit Ihren eigenen AufgabenDie Liste zeigt Rechenwerte. Ob ein Modell Ihre Aufgaben löst, zeigt erst ein Test mit Ihren eigenen Daten.

    Test besprechen

  • DeepSeek-R1-0528-Qwen3-8B
    Quantisierung
    BF16
    Runtime
    vLLM

    Repository angelegt am 29.05.2025 huggingface.co / DeepSeek-R1-0528-Qwen3-8B

    • Speicher reicht rechnerisch, 19,8 GiB bleiben frei
    • Geschwindigkeit nicht schätzbar
    • Eignung: keine unabhängigen Daten
    Speicherbedarf
    Bedarf je Gerät
    20,8 bis 23,4 GiB
    Verfügbar je Gerät
    43,2 GiB
    Antwortgeschwindigkeit
    Der Effizienzkorridor der Schätzung stammt aus einer Messreihe zu llama.cpp. Für andere Runtimes ist er nicht geprüft.Mit vLLM, unter Last oder mit Multi-Token-Prediction können reale Werte deutlich abweichen.
    Eignung für Ihre Aufgabe

    Für DeepSeek-R1-0528-Qwen3-8B liegt zur Aufgabe Coding keine Messung eines Herausgebers im Katalog.

    Der Katalog nennt 8,2 Milliarden Parameter, 32.768 Tokens Kontextlänge und das Anlagedatum 29.05.2025. Diese Angaben grenzen die Eignung ein, sie belegen sie nicht.

    Modellkarte von DeepSeek-R1-0528-Qwen3-8B beim Herausgeber öffnen

    Eignung selbst testen

    Offene Punkte

    Info

    • Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
    Warum diese Einschätzung

    Rechenweg und Quellen anzeigen

  • Qwen3-8B
    Quantisierung
    Q4_K_M
    Runtime
    llama.cpp

    Repository angelegt am 27.04.2025 huggingface.co / Qwen3-8B

    • Speicher reicht rechnerisch, 30,7 GiB bleiben frei
    • Geschwindigkeit nicht schätzbar
    • Eignung: nur Herstellerangaben
    Speicherbedarf
    Bedarf je Gerät
    10,2 bis 12,5 GiB
    Verfügbar je Gerät
    43,2 GiB
    Antwortgeschwindigkeit
    Eignung für Ihre Aufgabe
    Herstellerangabe

    LiveCodeBench v5 (2024.10–2025.02) / thinking: 57,5 %

    Angabe für die Modellvariante. Für diese Quantisierung liegt keine Messung vor.Thinking-Modus. Bis zu acht Versuche je Aufgabe. Die Quelle nennt keine Pass@8-Metrik. Herstellerangabe vom Mai 2025.Qwen Team, Qwen3 Technical Report (arXiv:2505.09388) · 14.05.2025

    Eignung selbst testen

    Offene Punkte

    Info

    • Planungsprofil ohne Gerät. Wählen Sie eine Karte aus der Geräteliste, dann prüft der Finder auch Runtime und Geschwindigkeit.
    Warum diese Einschätzung

    Rechenweg und Quellen anzeigen

Wie Sie ein Coding-LLM testen

Für Coding zählt, ob erzeugte Änderungen im eigenen Repository funktionieren. Die Modellgröße allein beantwortet das nicht. Stellen Sie Aufgaben aus Ihren Sprachen, Frameworks und vorhandenen Tests zusammen.

Der Rechner startet ohne festgelegtes Gerät mit einem hypothetischen CUDA-Profil von 48 GiB, 32.768 Tokens Kontext und einer Anfrage. Der Kontext soll Platz für Code und Aufgabenbeschreibung vorsehen. Passen Sie ihn an Ihre tatsächlichen Eingaben an.

Bewerten Sie Fehlerkorrekturen, Erweiterungen und das Verständnis vorhandenen Codes getrennt. Führen Sie Tests in einer isolierten Umgebung aus. Halten Sie fest, ob ein Patch kompiliert, Tests besteht und die Aufgabe vollständig löst.

Werkzeugaufrufe sind eine eigene Anforderung. Wenn Ihr Workflow Dateien liest, Tests startet oder Änderungen anwendet, aktivieren Sie die Werkzeugoption und prüfen Sie Modellvorlage und Runtime-Unterstützung. Messen Sie danach den vollständigen Ablauf statt nur die Generierung.

Modellinformationen

Der Katalog zeigt Parameter, Kontextlänge, Lizenz und Quelle. Ein Eintrag bestätigt nicht, dass das Modell auf Ihrer Hardware läuft.

Der Katalog führt 1.081 Modelle mit technischen Daten, 3.958 weitere nur namentlich und 1.154 Formatfassungen dieser Modelle. Die Suche findet alle drei.

Verzeichnis der Herausgeber

Der Finder liest die Modellkonten der Herausgeber vollständig. Diese Übersicht zeigt je Konto, wie viele Modelle er mit Daten rechnet und wie viele er bisher nur führt. Die einzelnen Namen finden Sie über die Suche darüber.

1.081 Modelle mit Daten, 3.958 weitere nur geführt, aus 53 Herausgeberkonten.

Für die nur geführten Modelle holt der nächste Abgleichlauf die technischen Daten. Bis dahin finden Sie den Namen über die Suche und das Modell über den Link auf das Konto.

Dazu kommen 1.154 Formatfassungen. Das ist dasselbe Modell als GGUF, MLX, FP8, NVFP4, AWQ oder GPTQ. Der Finder rechnet sie als Konfiguration des Originals und führt ihren Namen, damit die Suche ihn findet.

HerausgeberMit DatenNur geführtFormatfassungen
01-ai6220
ai21labs1114
Aleph-Alpha7133
allenai2579220
apple5492
arcee-ai2010159
baichuan-inc585
baidu1431
ByteDance-Seed12282
CohereLabs161412
deepseek-ai68480
google6674937
HuggingFaceTB223410
ibm-granite567560
IFM12149
inclusionAI2311837
internlm96929
JetBrains31116
kakaocorp1420
LGAI-EXAONE13928
LiquidAI1623106
llm-jp72423
meta-llama62307
microsoft8323429
MiniMaxAI1670
mistralai331716
moonshotai1600
naver-hyperclovax420
NousResearch177533
nvidia29423111
occiglot1000
openai5130
openbmb226861
openGPT-X300
OpenGVLab418123
PleIAs1275
Qwen86111239
rinna42627
Salesforce101045
sarvamai526
ServiceNow-AI711
Skywork13205
stabilityai16213
stepfun-ai14108
swiss-ai1309
tencent303338
tiiuae272659
trillionlabs8172
upstage1671
utter-project20160
xai-org200
XiaomiMiMo961
zai-org557622

Offener Katalog zum Abruf

Der Bestand, aus dem diese Seite rechnet, steht als offene Schnittstelle bereit. Jede Beobachtung nennt ihre Quelle, deren Lizenz und das Datum der Erhebung. Die Antworten sind JSON und seitenweise abrufbar, ein Zugang ist nicht nötig.

Ausgegeben wird nur, was die jeweilige Quelle zur Weitergabe mit Quellenangabe freigibt. Die Bedingungen der Quelle gelten auch für jede Weiterverwendung. Die Ausschlussregel steht im Kopfsatz. Datenstand .

Quellen und Lizenzen

Der Finder übernimmt einzelne Angaben aus diesen Quellen und rechnet sie in Speicher- und Eignungsangaben um. Die Quellen haben diese Auswertung nicht geprüft.

  • AMD
    Keine Lizenz für die Daten angegeben · Einzelangaben mit Quellenverweis · Abgerufen am 20.09.2026 · Quelldokumente: 15
  • Apple
    Keine Lizenz für die Daten angegeben · Einzelangaben mit Quellenverweis · Abgerufen am 17.09.2026 · Quelldokumente: 21
  • heise online, Jan-Keno Janssen
    Keine Lizenz für die Daten angegeben · Einzelangaben mit Quellenverweis · Abgerufen am 17.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste 01-ai
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste ai21labs
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste Aleph-Alpha
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste allenai
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste apple
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste arcee-ai
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste baichuan-inc
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste baidu
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste ByteDance-Seed
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste CohereLabs
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste deepseek-ai
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste google
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste HuggingFaceTB
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste ibm-granite
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste IFM
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste inclusionAI
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste internlm
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste JetBrains
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste kakaocorp
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste LGAI-EXAONE
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste LiquidAI
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste llm-jp
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste meta-llama
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste microsoft
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste MiniMaxAI
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste mistralai
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste moonshotai
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste naver-hyperclovax
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste NousResearch
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste nvidia
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste occiglot
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste openai
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste openbmb
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste openGPT-X
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste OpenGVLab
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste PleIAs
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste Qwen
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste rinna
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste Salesforce
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste sarvamai
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste ServiceNow-AI
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste Skywork
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste stabilityai
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste stepfun-ai
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste swiss-ai
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste tencent
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste tiiuae
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste trillionlabs
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste upstage
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste utter-project
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste xai-org
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste XiaomiMiMo
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste zai-org
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face Hub
    Lizenz: Apache 2.0; Eigene Lizenz des Herausgebers (Text in der Quelle); Gemma-Nutzungsbedingungen; Llama 3 Community License; Llama 3.1 Community License; Llama 3.2 Community License; Llama 3.3 Community License; MIT; MIT mit Bedingungen des Llama-Basismodells · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 3970
  • Intel
    Keine Lizenz für die Daten angegeben · Einzelangaben mit Quellenverweis · Abgerufen am 17.09.2026 · Quelldokumente: 7
  • Knoop, Holtmann (arXiv:2601.09527)
    Keine Lizenz für die Daten angegeben · Einzelangaben mit Quellenverweis · Abgerufen am 17.09.2026 · Quelldokumente: 1
  • llama-roofline, Manu Nicholas Jacob
    Lizenz: MIT · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 17.09.2026 · Quelldokumente: 1
  • llama.cpp, The ggml authors
    Lizenz: MIT · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 10
  • Max Vyaznikov, GPU Ark (Zenodo, doi:10.5281/zenodo.20390790)
    Lizenz: CC BY 4.0 · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 17.09.2026 · Quelldokumente: 1
  • Meta Llama
    Keine Lizenz für die Daten angegeben · Einzelangaben mit Quellenverweis · Abgerufen am 17.09.2026 · Quelldokumente: 2
  • MLX, MLX Contributors
    Lizenz: MIT · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 17.09.2026 · Quelldokumente: 1
  • mlx-lm, Apple Inc.
    Lizenz: MIT · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • mlx-lm, MLX Contributors
    Lizenz: MIT · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 17.09.2026 · Quelldokumente: 1
  • NVIDIA
    Keine Lizenz für die Daten angegeben · Einzelangaben mit Quellenverweis · Abgerufen am 20.09.2026 · Quelldokumente: 27
  • Qwen Team, Qwen3 Technical Report (arXiv:2505.09388)
    Keine Lizenz für die Daten angegeben · Einzelangaben mit Quellenverweis · Abgerufen am 17.09.2026 · Quelldokumente: 1
  • Qwen Team
    Keine Lizenz für die Daten angegeben · Einzelangaben mit Quellenverweis · Abgerufen am 17.09.2026 · Quelldokumente: 1
  • vLLM project
    Lizenz: Apache 2.0 · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 10
Berechnungsmethode

Die Speicherrechnung folgt der Methode memory-envelope-v1: weights + 2*layers*kv_heads*head_dim*kv_bytes*context*concurrency + workspace

Der KV-Cache bekommt 5 % Zuschlag für die Speicherverwaltung, die Dateigröße der Gewichte 3 %. Für den Arbeitsspeicher der Runtime sind 1,0 bis 3,0 GiB angesetzt. Vom Gerätespeicher bleiben 10 % als Reserve frei.

Die Annahmen stützen sich auf die vLLM-Dokumentation zur Speicheroptimierung und sind eine Planungsannahme von torck, erfasst am .

Rechenbeispiel für Devstral-Small-2-24B-Instruct-2512 in Q4_K_M auf Planungsprofil CUDA · 48 GiB mit 32.768 Tokens Kontext und gleichzeitigen Anfragen 1. Gewichte 13,3 bis 13,8 GiB, KV-Cache 5,0 bis 5,3 GiB, Arbeitsspeicher der Runtime 1,0 bis 3,0 GiB. Zusammen sind das 19,3 bis 22,0 GiB. Nutzbar sind 43,2 GiB.

Berechenbar heißt: Für die Modellvariante gibt es mindestens eine Konfiguration mit belegter Dateigröße. Das gilt für 400 von 1.081 Modellvarianten im Katalog. Die übrigen führt der Katalog mit technischen Daten, aber noch ohne rechenbare Konfiguration.

Der Speicherbedarf ist berechnet, nicht gemessen. Er setzt sich aus den Modellgewichten nach Dateigröße oder Bitbreite der Quantisierung, dem KV-Cache für Kontext und gleichzeitige Anfragen und dem Arbeitsspeicher der Runtime zusammen. Die Reserve bleibt frei.

Die Antwortgeschwindigkeit ist geschätzt, nicht gemessen. Die Obergrenze ist die Speicherbandbreite des Geräts geteilt durch die Bytes, die je erzeugtem Token gelesen werden. Das sind die aktiven Parameter mal Bytes je Gewicht plus der KV-Cache. Angezeigt wird eine Spanne von 60 bis 80 Prozent dieser Obergrenze. Dieser Korridor ist eine Faustregel, keine Genauigkeitszusage. Eine Zahl erscheint nur für CUDA und Metal, für eine einzelne Anfrage und für Modelle, die vollständig im Gerätespeicher liegen.

Für Runtime und Gerät nennt jede Konfiguration eine Nachweisstufe, etwa „Offiziell gebaut“ oder „Zielarchitektur im offiziellen Build“. Eine Nachweisstufe ist keine Aussage über Geschwindigkeit oder fehlerfreie Ausgabe. Fehlt ein Nachweis, steht der Grund bei den offenen Punkten.

Bei MoE-Modellen kann die Rechnung deutlich zu hoch liegen. Langer Kontext, Backend, Treiber und Build, mehrere gleichzeitige Anfragen, vLLM unter Last und Offload verändern die reale Rate. Für ROCm und SYCL zeigt der Finder keine Zahl, weil keine geprüfte Vergleichsmessung vorliegt. Die Verarbeitung des Prompts vor der ersten Antwort ist nicht eingerechnet.