OFFENE GEWICHTE · KURATIERT

Das richtige Modell ist nicht das größte.

Eine kuratierte Auswahl der leistungsfähigsten offenen Modelle. Vom 8-Milliarden-Parameter-Modell auf einer einzelnen GPU bis zu großen Mixture-of-Experts-Modellen auf einem Mehr-GPU-Knoten. Sie wählen, was zu Domäne, Hardware-Klasse und Antwortqualität passt.

§01

Modell-Katalog.

NACH KATEGORIE FILTERN · LOKAL & CLOUD
Kategorie
Z.ai

GLM 5.2

Text

Großes Reasoning-Modell mit 1M-Kontext, stark bei langen Agenten- und Coding-Aufgaben.

Reasoning1M KontextMoEMIT
Moonshot AI

Kimi K3

Text

Agentisches Modell für langlaufende Aufgaben, mit Coding-Varianten.

Agentischlanger KontextApache 2.0
Google

Gemma 4

Text

Kompaktes, effizientes Modell — läuft gut auf schlanker Hardware.

Effizientkompakt
Alibaba

Qwen3.6

Text

Vielseitiges MoE-Modell für eine einzelne GPU, mit Tool-Calling und Vision.

AllroundMoEVisionApache 2.0
MiniMax

MiniMax M2.7

Text

Günstiger 1M-Kontext und native Multimodalität in einem offenen Modell.

Multimodal1M Kontext
NVIDIA

Nemotron 3 · Super / Ultra

Text

Auf Reasoning und Effizienz getrimmt, für NVIDIA-Hardware abgestimmt.

Reasoningeffizient
DeepSeek

DeepSeek V4 · Flash / Pro

Text

Mixture-of-Experts mit starkem Reasoning bei niedrigen Kosten.

ReasoningMoEMIT
Mistral AI

Mistral Small 4 · Devstral 2

Text

Schlankes EU-Modell; Devstral speziell fürs Programmieren.

Code / AllroundApache 2.0
Mistral AI

Mistral Medium 3.5 · Large 3

Text

Größere Mistral-Modelle — nur als Cloud-API verfügbar.

AllroundCloud · nicht lokal
OpenAI

GPT OSS

Text

OpenAIs offenes Gewicht — lokal lauffähiges Allround-Modell.

AllroundApache 2.0
Alibaba

Qwen3-TTS

Text → Sprache

Mehrsprachige Sprachsynthese.

Sprachsynthesemehrsprachig
Microsoft

VibeVoice

Text → Sprache

Ausdrucksstarke Sprachausgabe für lange, mehrstimmige Texte (bis 90 Min).

Sprachsynthesemehrstimmig
BosonAI

Higgs TTS

Text → Sprache

Sehr natürliche Sprache mit Stimmklonung und Dialogen.

SprachsyntheseVoice-CloningApache 2.0
Hexgrad

Kokoro

Text → Sprache

Winziges (82M), schnelles TTS — sehr sparsam im Betrieb.

Kompakt82M
Fish Audio

S2 Pro

Text → Sprache

Hochwertige Sprachsynthese.

Sprachsynthese
Canopy AI

Orpheus

Text → Sprache

Natürliche, emotionale Sprachausgabe (Llama-basiert).

Sprachsynthese
Moonshot AI

Kimi Audio

Text → Sprache

Audio-Modell für Sprachein- und -ausgabe.

Audio
Mistral AI

Voxtral

Text → Sprache

Offenes Audio-Modell: Transkription und Verstehen von Sprache.

AudioApache 2.0
NVIDIA

Parakeet

Sprache → Text

Sehr schnelle ASR (600M), 25 Sprachen.

Transkription600M25 Sprachen
NVIDIA

Nemotron ASR

Sprache → Text

Spracherkennung im NVIDIA-NeMo-Stack.

Transkription
Whisper (OpenAI)

Whisper.cpp

Sprache → Text

Effiziente lokale Transkription (Whisper in C/C++).

TranskriptionCPU-fähig
Microsoft

VibeVoice ASR

Sprache → Text

Spracherkennung aus der VibeVoice-Familie.

Transkription
Alibaba

Qwen3 ASR

Sprache → Text

Mehrsprachige Spracherkennung.

Transkriptionmehrsprachig
Cohere

Cohere Transcribe

Sprache → Text

Transkriptions-Dienst — nur als Cloud-API.

TranskriptionCloud · nicht lokal
Mistral AI

Voxtral (Realtime)

Sprache → Text

Offene Transkription in Echtzeit, mit Audio-Verständnis.

TranskriptionEchtzeitApache 2.0
BosonAI

Higgs Audio STT

Sprache → Text

Audio-Verständnis und Transkription.

Transkription
Black Forest Labs

FLUX.1 (Dev / Schnell) · Flux.2

Text → Bild

Führende offene Bildgenerierung, bis 4 MP, Multi-Referenz.

Text→Bildbis 4 MP
Tongyi Lab

Z-Image (Turbo)

Text → Bild

Sehr effizientes 6B-Bildmodell für schnelle Generierung.

Text→Bild6B
Stability AI

Stable Diffusion (SDXL / 2)

Text → Bild

Der offene Klassiker der Bildgenerierung, riesiges Ökosystem.

Text→Bild
Alibaba

Qwen Image (Edit)

Text → Bild

Bildgenerierung und intelligentes Editieren mit Text-Verständnis.

Text→Bild · Edit
Z.ai

GLM Image

Text → Bild

Hybrid aus Autoregression und Diffusion, stark bei Typografie.

Text→Bild
RunDiffusion

Juggernaut XL

Text → Bild

Fotorealistisches SDXL-Feintuning, Community-Favorit.

Text→BildSDXL
Ideogram

Ideogram 4

Text → Bild

Erstes offenes Ideogram-Modell (9,3B), stark bei Text im Bild.

Text→Bild9,3B
Krea

Krea 2 (Turbo)

Text → Bild

Foundation-Bildmodell (Raw/Turbo), auf Ästhetik getrimmt.

Text→Bild
Lightricks

LTX Video

Text → Video

Erstes offenes Modell mit 4K Audio+Video in einem Durchlauf, sehr schnell.

Text→Video4KAudio+Video
Alibaba

Wan

Text → Video

Ein Modell für Text-zu-Video, Bild-zu-Video und Editing; top Fotorealismus.

Text→Video
Tencent

Hunyuan Video

Text → Video

Kinoreife Ästhetik, 8,3B, schnell.

Text→Video8,3B
Meituan

LongCat Video

Text → Video

Video-Generierung, auf lange Clips ausgelegt.

Text→Video

OmniAvatar

Text → Video

Sprechende Avatare / Video aus Bild und Audio.

Avatar

Neodragon

Text → Video

Video-Generierungsmodell.

Text→Video
Krea

Krea (Realtime)

Text → Video

Video-Generierung in Echtzeit.

Echtzeit-VideoEchtzeit
Stability AI

Stable Audio 3

Text → Musik

Sounddesign und Klangtexturen (kurze Samples / SFX).

Audio · Sound
Google

Magenta Realtime

Text → Musik

Echtzeit-Musikgenerierung, offenes Google-Projekt.

MusikEchtzeit
ACE-Step

Ace-Step

Text → Musik

Ganze Songs in ~20 s, mit starkem Remix-/Edit-Werkzeug.

MusikSongs
Meta

MusicGen

Text → Musik

Text-zu-Musik, Stereo-Hintergrundmusik aus Prompts.

MusikStereo

Tango2

Text → Musik

Text-zu-Audio-Generierung.

Text→Audio
Nari Labs

Dia

Text → Musik

Ausdrucksstarke Dialog-Sprachsynthese.

Dialog-TTS

Überblick aktueller Modelle nach Kategorie. Ohne Kennzeichnung: lokal auf der Appliance lauffähig; der Tag „Cloud · nicht lokal" verweist auf proprietäre Dienste als Referenz. Dazu viele weitere Aufgaben — Bild- und Textklassifizierung, Bildsegmentierung, Objekterkennung, Bildmasken, Gaussian Splatting (3D aus Fotos/Videos) u. v. m. Welches Modell zu Ihrer Domäne und Hardware passt, entscheiden wir gemeinsam.

§02

Modellwahl & Update-Pfad.

MODELL ZIEHT NACH · HARDWARE BLEIBT

Sie kaufen kein eingefrorenes Modell. Die Hardware bleibt — erscheint ein besseres offenes Modell, zieht das Modell nach.

01

Kuratierte Auswahl

Wir wählen bewährte, offene Modelle passend zu Ihrer Hardware-Klasse und Ihrem Anwendungsfall — statt eines generischen Cloud-Modells.

02

Auf Ihre Daten angebunden

Ihr Fachwissen wird per RAG angebunden — Ihre Begriffe, Ihre Dokumente. Das Modell selbst wird nicht nachtrainiert; Ihre Daten bleiben im Haus.

03

Quantisierung für Ihre GPU

Für genau Ihre Hardware-Klasse quantisiert — maximale Antwortqualität pro VRAM, kein generisches Cloud-Modell.

04

Update-Pfad

Erscheint ein besseres offenes Modell, kann es als Update eingespielt werden — die Hardware bleibt, das Modell zieht nach. Ein Modellwechsel kann das Verhalten Ihrer Workflows verändern (je kleiner das Modell, desto eher), deshalb stimmen wir ihn vorher mit Ihnen ab und prüfen ihn gemeinsam. Ihre Daten verlassen das Haus nie.

Welches Modell passt zu Ihnen?

Das entscheiden wir nicht per Datenblatt, sondern nach Ihrer Domäne, Hardware-Klasse und Antwortqualität — im Erstgespräch.

Erstgespräch vereinbaren →
Erstgespräch vereinbaren →