GLM 5.2
Großes Reasoning-Modell mit 1M-Kontext, stark bei langen Agenten- und Coding-Aufgaben.
Eine kuratierte Auswahl der leistungsfähigsten offenen Modelle. Vom 8-Milliarden-Parameter-Modell auf einer einzelnen GPU bis zu großen Mixture-of-Experts-Modellen auf einem Mehr-GPU-Knoten. Sie wählen, was zu Domäne, Hardware-Klasse und Antwortqualität passt.
Großes Reasoning-Modell mit 1M-Kontext, stark bei langen Agenten- und Coding-Aufgaben.
Agentisches Modell für langlaufende Aufgaben, mit Coding-Varianten.
Kompaktes, effizientes Modell — läuft gut auf schlanker Hardware.
Vielseitiges MoE-Modell für eine einzelne GPU, mit Tool-Calling und Vision.
Günstiger 1M-Kontext und native Multimodalität in einem offenen Modell.
Auf Reasoning und Effizienz getrimmt, für NVIDIA-Hardware abgestimmt.
Mixture-of-Experts mit starkem Reasoning bei niedrigen Kosten.
Schlankes EU-Modell; Devstral speziell fürs Programmieren.
Größere Mistral-Modelle — nur als Cloud-API verfügbar.
OpenAIs offenes Gewicht — lokal lauffähiges Allround-Modell.
Mehrsprachige Sprachsynthese.
Ausdrucksstarke Sprachausgabe für lange, mehrstimmige Texte (bis 90 Min).
Sehr natürliche Sprache mit Stimmklonung und Dialogen.
Winziges (82M), schnelles TTS — sehr sparsam im Betrieb.
Hochwertige Sprachsynthese.
Natürliche, emotionale Sprachausgabe (Llama-basiert).
Audio-Modell für Sprachein- und -ausgabe.
Offenes Audio-Modell: Transkription und Verstehen von Sprache.
Sehr schnelle ASR (600M), 25 Sprachen.
Spracherkennung im NVIDIA-NeMo-Stack.
Effiziente lokale Transkription (Whisper in C/C++).
Spracherkennung aus der VibeVoice-Familie.
Mehrsprachige Spracherkennung.
Transkriptions-Dienst — nur als Cloud-API.
Offene Transkription in Echtzeit, mit Audio-Verständnis.
Audio-Verständnis und Transkription.
Führende offene Bildgenerierung, bis 4 MP, Multi-Referenz.
Sehr effizientes 6B-Bildmodell für schnelle Generierung.
Der offene Klassiker der Bildgenerierung, riesiges Ökosystem.
Bildgenerierung und intelligentes Editieren mit Text-Verständnis.
Hybrid aus Autoregression und Diffusion, stark bei Typografie.
Fotorealistisches SDXL-Feintuning, Community-Favorit.
Erstes offenes Ideogram-Modell (9,3B), stark bei Text im Bild.
Foundation-Bildmodell (Raw/Turbo), auf Ästhetik getrimmt.
Erstes offenes Modell mit 4K Audio+Video in einem Durchlauf, sehr schnell.
Ein Modell für Text-zu-Video, Bild-zu-Video und Editing; top Fotorealismus.
Kinoreife Ästhetik, 8,3B, schnell.
Video-Generierung, auf lange Clips ausgelegt.
Sprechende Avatare / Video aus Bild und Audio.
Video-Generierungsmodell.
Video-Generierung in Echtzeit.
Sounddesign und Klangtexturen (kurze Samples / SFX).
Echtzeit-Musikgenerierung, offenes Google-Projekt.
Ganze Songs in ~20 s, mit starkem Remix-/Edit-Werkzeug.
Text-zu-Musik, Stereo-Hintergrundmusik aus Prompts.
Text-zu-Audio-Generierung.
Ausdrucksstarke Dialog-Sprachsynthese.
Überblick aktueller Modelle nach Kategorie. Ohne Kennzeichnung: lokal auf der Appliance lauffähig; der Tag „Cloud · nicht lokal" verweist auf proprietäre Dienste als Referenz. Dazu viele weitere Aufgaben — Bild- und Textklassifizierung, Bildsegmentierung, Objekterkennung, Bildmasken, Gaussian Splatting (3D aus Fotos/Videos) u. v. m. Welches Modell zu Ihrer Domäne und Hardware passt, entscheiden wir gemeinsam.
Sie kaufen kein eingefrorenes Modell. Die Hardware bleibt — erscheint ein besseres offenes Modell, zieht das Modell nach.
Wir wählen bewährte, offene Modelle passend zu Ihrer Hardware-Klasse und Ihrem Anwendungsfall — statt eines generischen Cloud-Modells.
Ihr Fachwissen wird per RAG angebunden — Ihre Begriffe, Ihre Dokumente. Das Modell selbst wird nicht nachtrainiert; Ihre Daten bleiben im Haus.
Für genau Ihre Hardware-Klasse quantisiert — maximale Antwortqualität pro VRAM, kein generisches Cloud-Modell.
Erscheint ein besseres offenes Modell, kann es als Update eingespielt werden — die Hardware bleibt, das Modell zieht nach. Ein Modellwechsel kann das Verhalten Ihrer Workflows verändern (je kleiner das Modell, desto eher), deshalb stimmen wir ihn vorher mit Ihnen ab und prüfen ihn gemeinsam. Ihre Daten verlassen das Haus nie.
Das entscheiden wir nicht per Datenblatt, sondern nach Ihrer Domäne, Hardware-Klasse und Antwortqualität — im Erstgespräch.