Finden Sie ein Sprachmodell, das zu Ihrer Hardware und Anwendung passt. Vergleichen Sie Konfigurationen und berechnen Sie den Speicherbedarf für Ihren Einsatz.

torck LLM Finder

Ihre Anforderungen

400 berechenbare Modelle · 1.092 Konfigurationen · 93 Hardwareoptionen · Datenstand
Einstieg

Ihre Hardware steht fest. Der Finder prüft passende Modellkonfigurationen auf diesem Gerät.

Ihr Modell steht fest. Der Finder prüft, auf welcher erfassten Hardware es unter diesen Angaben läuft.

Sie beschreiben Aufgabe und Anforderungen. Der Finder filtert Konfigurationen nach diesen Angaben.

Wählen Sie zwei bis vier Konfigurationen für den direkten Vergleich.

Bis zu vier Konfigurationen auswählen

Suchen Sie nach Modell, Quantisierung oder Laufzeit. 1.092 Konfigurationen stehen zur Auswahl.

Noch nichts gewählt. Suchen Sie oben nach einem Modell, um Konfigurationen zu vergleichen.

Die Aufgabe legt die Richtgröße für die Geschwindigkeit in der Auswahl fest. Bei Agenten prüft der Finder zusätzlich die Unterstützung externer Werkzeuge. Nach Antwortqualität filtert die Aufgabe nicht.

Hardware noch offen: mit einem Planungsprofil von 48 GiB starten

Weitere 681 Modelle stehen im Katalog und werden nicht berechnet: 402 ohne quantisierte Fassung bei einem zugelassenen Konto, 254 Grund nicht hinterlegt, 20 keine Sprachmodellauswahl, 5 Formatfassung eines anderen Modells. Zur Modellübersicht
Tokens pro Anfrage, einschließlich Eingabe, Verlauf und geplanter Ausgabe.
Anzahl der Anfragen, die gleichzeitig verarbeitet werden.
Weitere Einstellungen
Fehlende Lizenzinformationen werden als ungeklärt angezeigt.
Wählen Sie eine Sprache. Fehlt ein unabhängiger Test, bleibt die Eignung ungeklärt.
Die Runtime führt das Modell aus. Version, Format und Hardware müssen zusammenpassen.
Die Quantisierung legt fest, wie viele Bits pro Modellwert gespeichert werden. Sie beeinflusst den Speicherbedarf und kann die Qualität beeinflussen.

Workspace ist zusätzlicher Arbeitsspeicher für Zwischenergebnisse und die Runtime. Die angegebene Spanne ist geschätzt. Sie hängt davon ab, wie viele Tokens gemeinsam verarbeitet werden und welche Runtime Sie verwenden. Speicher für Bildverarbeitung kommt gegebenenfalls hinzu.

Der KV-Cache speichert Zwischenstände laufender Anfragen. Kontextlänge und Zahl gleichzeitiger Anfragen erhöhen seinen Speicherbedarf.

GPU-Speicher und CPU-RAM können je nach Konfiguration gemeinsam genutzt werden. Die tatsächliche Verteilung kann abweichen.

Wählen Sie einen Einstieg, ergänzen Sie Ihre Anforderungen und berechnen Sie die Konfigurationen.

Modellinformationen

Der Katalog zeigt Parameter, Kontextlänge, Lizenz und Quelle. Ein Eintrag bestätigt nicht, dass das Modell auf Ihrer Hardware läuft.

Der Katalog führt 1.081 Modelle mit technischen Daten, 3.958 weitere nur namentlich und 1.154 Formatfassungen dieser Modelle. Die Suche findet alle drei.

Verzeichnis der Herausgeber

Der Finder liest die Modellkonten der Herausgeber vollständig. Diese Übersicht zeigt je Konto, wie viele Modelle er mit Daten rechnet und wie viele er bisher nur führt. Die einzelnen Namen finden Sie über die Suche darüber.

1.081 Modelle mit Daten, 3.958 weitere nur geführt, aus 53 Herausgeberkonten.

Für die nur geführten Modelle holt der nächste Abgleichlauf die technischen Daten. Bis dahin finden Sie den Namen über die Suche und das Modell über den Link auf das Konto.

Dazu kommen 1.154 Formatfassungen. Das ist dasselbe Modell als GGUF, MLX, FP8, NVFP4, AWQ oder GPTQ. Der Finder rechnet sie als Konfiguration des Originals und führt ihren Namen, damit die Suche ihn findet.

HerausgeberMit DatenNur geführtFormatfassungen
01-ai6220
ai21labs1114
Aleph-Alpha7133
allenai2579220
apple5492
arcee-ai2010159
baichuan-inc585
baidu1431
ByteDance-Seed12282
CohereLabs161412
deepseek-ai68480
google6674937
HuggingFaceTB223410
ibm-granite567560
IFM12149
inclusionAI2311837
internlm96929
JetBrains31116
kakaocorp1420
LGAI-EXAONE13928
LiquidAI1623106
llm-jp72423
meta-llama62307
microsoft8323429
MiniMaxAI1670
mistralai331716
moonshotai1600
naver-hyperclovax420
NousResearch177533
nvidia29423111
occiglot1000
openai5130
openbmb226861
openGPT-X300
OpenGVLab418123
PleIAs1275
Qwen86111239
rinna42627
Salesforce101045
sarvamai526
ServiceNow-AI711
Skywork13205
stabilityai16213
stepfun-ai14108
swiss-ai1309
tencent303338
tiiuae272659
trillionlabs8172
upstage1671
utter-project20160
xai-org200
XiaomiMiMo961
zai-org557622

Offener Katalog zum Abruf

Der Bestand, aus dem diese Seite rechnet, steht als offene Schnittstelle bereit. Jede Beobachtung nennt ihre Quelle, deren Lizenz und das Datum der Erhebung. Die Antworten sind JSON und seitenweise abrufbar, ein Zugang ist nicht nötig.

Ausgegeben wird nur, was die jeweilige Quelle zur Weitergabe mit Quellenangabe freigibt. Die Bedingungen der Quelle gelten auch für jede Weiterverwendung. Die Ausschlussregel steht im Kopfsatz. Datenstand .

Quellen und Lizenzen

Der Finder übernimmt einzelne Angaben aus diesen Quellen und rechnet sie in Speicher- und Eignungsangaben um. Die Quellen haben diese Auswertung nicht geprüft.

  • AMD
    Keine Lizenz für die Daten angegeben · Einzelangaben mit Quellenverweis · Abgerufen am 20.09.2026 · Quelldokumente: 15
  • Apple
    Keine Lizenz für die Daten angegeben · Einzelangaben mit Quellenverweis · Abgerufen am 17.09.2026 · Quelldokumente: 21
  • heise online, Jan-Keno Janssen
    Keine Lizenz für die Daten angegeben · Einzelangaben mit Quellenverweis · Abgerufen am 17.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste 01-ai
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste ai21labs
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste Aleph-Alpha
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste allenai
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste apple
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste arcee-ai
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste baichuan-inc
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste baidu
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste ByteDance-Seed
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste CohereLabs
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste deepseek-ai
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste google
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste HuggingFaceTB
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste ibm-granite
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste IFM
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste inclusionAI
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste internlm
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste JetBrains
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste kakaocorp
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste LGAI-EXAONE
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste LiquidAI
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste llm-jp
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste meta-llama
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste microsoft
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste MiniMaxAI
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste mistralai
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste moonshotai
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste naver-hyperclovax
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste NousResearch
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste nvidia
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste occiglot
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste openai
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste openbmb
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste openGPT-X
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste OpenGVLab
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste PleIAs
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste Qwen
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste rinna
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste Salesforce
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste sarvamai
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste ServiceNow-AI
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste Skywork
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste stabilityai
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste stepfun-ai
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste swiss-ai
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste tencent
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste tiiuae
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste trillionlabs
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste upstage
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste utter-project
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste xai-org
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste XiaomiMiMo
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face, Modellliste zai-org
    Lizenz: Eigene Lizenz des Herausgebers (Text in der Quelle) · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • Hugging Face Hub
    Lizenz: Apache 2.0; Eigene Lizenz des Herausgebers (Text in der Quelle); Gemma-Nutzungsbedingungen; Llama 3 Community License; Llama 3.1 Community License; Llama 3.2 Community License; Llama 3.3 Community License; MIT; MIT mit Bedingungen des Llama-Basismodells · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 3970
  • Intel
    Keine Lizenz für die Daten angegeben · Einzelangaben mit Quellenverweis · Abgerufen am 17.09.2026 · Quelldokumente: 7
  • Knoop, Holtmann (arXiv:2601.09527)
    Keine Lizenz für die Daten angegeben · Einzelangaben mit Quellenverweis · Abgerufen am 17.09.2026 · Quelldokumente: 1
  • llama-roofline, Manu Nicholas Jacob
    Lizenz: MIT · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 17.09.2026 · Quelldokumente: 1
  • llama.cpp, The ggml authors
    Lizenz: MIT · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 10
  • Max Vyaznikov, GPU Ark (Zenodo, doi:10.5281/zenodo.20390790)
    Lizenz: CC BY 4.0 · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 17.09.2026 · Quelldokumente: 1
  • Meta Llama
    Keine Lizenz für die Daten angegeben · Einzelangaben mit Quellenverweis · Abgerufen am 17.09.2026 · Quelldokumente: 2
  • MLX, MLX Contributors
    Lizenz: MIT · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 17.09.2026 · Quelldokumente: 1
  • mlx-lm, Apple Inc.
    Lizenz: MIT · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 1
  • mlx-lm, MLX Contributors
    Lizenz: MIT · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 17.09.2026 · Quelldokumente: 1
  • NVIDIA
    Keine Lizenz für die Daten angegeben · Einzelangaben mit Quellenverweis · Abgerufen am 20.09.2026 · Quelldokumente: 27
  • Qwen Team, Qwen3 Technical Report (arXiv:2505.09388)
    Keine Lizenz für die Daten angegeben · Einzelangaben mit Quellenverweis · Abgerufen am 17.09.2026 · Quelldokumente: 1
  • Qwen Team
    Keine Lizenz für die Daten angegeben · Einzelangaben mit Quellenverweis · Abgerufen am 17.09.2026 · Quelldokumente: 1
  • vLLM project
    Lizenz: Apache 2.0 · Nutzung nach Lizenz und Nutzungsbedingungen · Abgerufen am 18.09.2026 · Quelldokumente: 10
Berechnungsmethode

Der Speicherbedarf ist berechnet, nicht gemessen. Er setzt sich aus den Modellgewichten nach Dateigröße oder Bitbreite der Quantisierung, dem KV-Cache für Kontext und gleichzeitige Anfragen und dem Arbeitsspeicher der Runtime zusammen. Die Reserve bleibt frei.

Die Antwortgeschwindigkeit ist geschätzt, nicht gemessen. Die Obergrenze ist die Speicherbandbreite des Geräts geteilt durch die Bytes, die je erzeugtem Token gelesen werden. Das sind die aktiven Parameter mal Bytes je Gewicht plus der KV-Cache. Angezeigt wird eine Spanne von 60 bis 80 Prozent dieser Obergrenze. Dieser Korridor ist eine Faustregel, keine Genauigkeitszusage. Eine Zahl erscheint nur für CUDA und Metal, für eine einzelne Anfrage und für Modelle, die vollständig im Gerätespeicher liegen.

Für Runtime und Gerät nennt jede Konfiguration eine Nachweisstufe, etwa „Offiziell gebaut“ oder „Zielarchitektur im offiziellen Build“. Eine Nachweisstufe ist keine Aussage über Geschwindigkeit oder fehlerfreie Ausgabe. Fehlt ein Nachweis, steht der Grund bei den offenen Punkten.

Bei MoE-Modellen kann die Rechnung deutlich zu hoch liegen. Langer Kontext, Backend, Treiber und Build, mehrere gleichzeitige Anfragen, vLLM unter Last und Offload verändern die reale Rate. Für ROCm und SYCL zeigt der Finder keine Zahl, weil keine geprüfte Vergleichsmessung vorliegt. Die Verarbeitung des Prompts vor der ersten Antwort ist nicht eingerechnet.

VRAM-Bedarf berechnen und Modelle vergleichen

Ein Modellname reicht für die Auswahl nicht aus. Quantisierung, Runtime, Kontextlänge und gleichzeitige Anfragen bestimmen, wie viel VRAM eine Konfiguration belegt. Der Rechner ermittelt diesen Bedarf und stellt ihn dem Speicher der gewählten GPU gegenüber.

Wie Kontextlänge und gleichzeitige Anfragen den VRAM-Bedarf erhöhen

Der Kontext umfasst Eingabe, Gesprächsverlauf und geplante Ausgabe. Wenn mehrere Anfragen gleichzeitig laufen, muss die Runtime deren Zwischenstände im VRAM halten. Deshalb kann eine Konfiguration für eine einzelne Anfrage passen und bei mehreren Anfragen mehr VRAM benötigen.

Was ein passendes Ergebnis bedeutet

„Passt“ bezieht sich auf den berechneten Speicherbedarf unter den angegebenen Annahmen. Die Antwortqualität und Geschwindigkeit müssen Sie mit typischen Aufgaben Ihrer Anwendung messen. Ein Benchmark allein reicht dafür nicht aus. Bei jeder Konfiguration finden Sie Quellen, Datenstand und Hinweise auf fehlende Messungen.

Offene Modellgewichte und Open Source

Verfügbare Modellgewichte sind eine Information über den Zugang zum Modell. Für die Auswahl sind auch Lizenzbedingungen, verfügbarer Code und dokumentierte Trainingsinformationen relevant. Der Finder kennzeichnet fehlende Angaben. Eine individuelle Lizenzprüfung ersetzt er nicht.

Welche GPU zu welchem Modell passt

Im Gerätefeld stehen Grafikkarten von NVIDIA, AMD und Intel sowie Macs mit Apple Silicon. Der Rechner vergleicht den ermittelten VRAM-Bedarf mit dem Speicher des ausgewählten Geräts und zeigt, welche Quantisierungsstufe darauf noch läuft. Bis zu vier Konfigurationen lassen sich dabei nebeneinander stellen.

Ihre Modellauswahl im Projekt prüfenWir vergleichen Modelle mit Ihren Aufgaben und prüfen, was für Integration und Betrieb nötig ist. Beschreiben Sie uns Ihr Vorhaben im Kontaktformular.

Die Grundlagen finden Sie im LLM-Vergleich. Für den Einsatz mit eigenen Unternehmensdaten lesen Sie unsere Beiträge zu privater KI und RAG. Wer die Modellauswahl im Projekt klären will, findet den Rahmen dafür unter KI-Beratung.