DeepSeek V4 Flash ist am 31. Juli 2026 das günstigste große API-Modell im reinen Tokenvergleich. Für europäische Unternehmen bietet Mistral Small 4 jedoch das überzeugendere Gesamtpaket. Das Modell kostet nur 0,15 Dollar je Million Input-Token und 0,60 Dollar je Million Output-Token, läuft standardmäßig auf EU-Servern und steht zusätzlich mit offenen Gewichten bereit. GPT-5.6 Luna folgt beim Preis nur knapp dahinter. OpenAI verlangt 0,20 Dollar beim Input und 1,20 Dollar beim Output. Dafür erhalten Entwickler ein Kontextfenster mit 1,05 Millionen Token, Bildverarbeitung, Funktionsaufrufe, Websuche, Dateisuche und Computersteuerung.
Google stellt mit Gemini 3.5 Flash-Lite das vielseitigste günstige Multimodalmodell. Es verarbeitet neben Text und Bildern auch Video, Audio und PDF-Dateien. Der Preis liegt bei 0,30 Dollar beim Input und 2,50 Dollar beim Output.
Der Monatsvergleich ordnet die wichtigsten KI-Modelle nach einem einheitlichen Stichtag. Der billigste Token gewinnt nicht automatisch. Kontextfenster, Werkzeugzugriff, Tokenizer, Datenstandort und unterstützte Medien können die tatsächlichen Projektkosten deutlich verändern.
Das Ergebnis nach Einsatzbereich:
- Niedrigster Rohpreis: DeepSeek V4 Flash
- Bestes EU-Gesamtpaket: Mistral Small 4
- Günstige Agenten mit großem Kontext: GPT-5.6 Luna
- Günstige Bild-, Video- und Audioanalyse: Gemini 3.5 Flash-Lite
- Komplexe Coding- und Agentenaufgaben: Claude Sonnet 5 zum Aktionspreis
- Günstiges Premium-Output: Grok 4.3 bei weniger als 200.000 Kontext-Token
- Meta-Alternative: Muse Spark 1.1 bleibt vorerst auf die USA begrenzt
| Modell | Input / Output je 1 Mio. Token | Beispielkosten: 1 Mio. Input plus 250.000 Output |
|---|---|---|
| DeepSeek V4 Flash | 0,14 / 0,28 Dollar | 0,21 Dollar |
| Mistral Small 4 | 0,15 / 0,60 Dollar | 0,30 Dollar |
| OpenAI GPT-5.6 Luna | 0,20 / 1,20 Dollar | 0,50 Dollar |
| Google Gemini 3.5 Flash-Lite | 0,30 / 2,50 Dollar | 0,93 Dollar |
| xAI Grok 4.3 | 1,25 / 2,50 Dollar | 1,88 Dollar |
| Meta Muse Spark 1.1 | 1,25 / 4,25 Dollar | 2,31 Dollar |
| Google Gemini 3.6 Flash | 1,50 / 7,50 Dollar | 3,38 Dollar |
| Anthropic Claude Sonnet 5 | 2,00 / 10,00 Dollar | 4,50 Dollar |
| Cohere Command A | 2,50 / 10,00 Dollar | 5,00 Dollar |
DeepSeek gewinnt den Rohpreis, Mistral den EU-Gesamtvergleich
DeepSeek V4 Flash setzt die niedrigste Preismarke des Monats. Eine Beispielanfrage mit einer Million Input-Token und 250.000 Output-Token kostet nur rund 21 Cent. Cache-Treffer reduzieren den Inputpreis sogar auf 0,0028 Dollar je Million Token.
Das Modell bietet eine Million Token Kontext, bis zu 384.000 Output-Token, JSON-Ausgaben und Funktionsaufrufe. DeepSeek kündigt allerdings ein neues Spitzenlastmodell an. Während festgelegter Tageszeiten in China sollen sich sämtliche Preise verdoppeln. Ein Starttermin steht noch aus.
Der niedrige Preis besitzt außerdem eine wichtige Einschränkung für europäische Unternehmen. DeepSeek verarbeitet und speichert personenbezogene Daten laut eigener Datenschutzerklärung in China. Sensible Kunden-, Personal- oder Unternehmensdaten benötigen deshalb eine gesonderte rechtliche und technische Prüfung.
Mistral Small 4 kostet in der Beispielrechnung nur neun Cent mehr. Das Modell besitzt ein kleineres Kontextfenster mit 256.000 Token. Es bietet dafür mehrere Vorteile:
- standardmäßiges Hosting in der Europäischen Union
- offene Gewichte für eigene Installationen
- Text-, Bild-, Reasoning- und Coding-Funktionen
- Funktionsaufrufe und strukturierte Ausgaben
- geringe Kosten ohne regionalen Preisaufschlag
- möglicher Eigenbetrieb bei hohen oder sensiblen Lasten
Diese Kombination macht Mistral Small 4 zum Preis-Leistungs-Sieger für viele europäische Text-, Dokumenten- und Coding-Anwendungen. Das Ergebnis gilt nicht für jede Aufgabe. Projekte mit mehr als 256.000 Token Kontext benötigen ein anderes Modell.
GPT-5.6 Luna ist die günstigste direkte Alternative mit mehr als einer Million Token Kontext und einem umfangreichen Werkzeugsatz. Die Beispielrechnung endet bei 50 Cent. Für eine garantierte europäische Verarbeitung erhebt OpenAI bei geeigneten neuen Modellen zehn Prozent Aufschlag.
OpenAI trennt zudem kurze und lange Kontexte. Große Anfragen oberhalb der festgelegten Schwelle kosten bei GPT-5.6 Luna 0,40 Dollar beim Input und 1,80 Dollar beim Output. Lange Dokumente können den Preis damit sichtbar erhöhen.
Gemini 3.5 Flash-Lite kostet mit 93 Cent im Beispiel fast doppelt so viel wie GPT-5.6 Luna. Google verarbeitet dafür die größte Auswahl an Eingabeformaten. Text, Bilder, Video, Audio und PDF-Dateien laufen über dasselbe Modell und dieselbe Preisstruktur.
Batch- und Flex-Aufträge halbieren den Preis auf 0,15 Dollar beim Input und 1,25 Dollar beim Output. Zeitunkritische Dokumentenanalyse, Klassifizierung oder Datenextraktion kann dadurch günstiger als mit OpenAI ausfallen.
Google positioniert das stärkere Gemini 3.6 Flash für autonome Agenten. Das Modell kostet 1,50 Dollar beim Input und 7,50 Dollar beim Output. Es lohnt sich vor allem bei Aufgaben mit höherem Planungs- und Reasoningbedarf.
Claude Sonnet 5 gehört nicht zur Budgetklasse. Anthropic verlangt bis Ende August 2 Dollar beim Input und 10 Dollar beim Output. Ab September steigt der reguläre Preis auf 3 und 15 Dollar.
Der neue Tokenizer erschwert einen direkten Vergleich. Derselbe Text erzeugt laut Anthropic rund 30 Prozent mehr Token als bei Claude Sonnet 4.6. Die reale Rechnung kann deshalb trotz unverändert wirkender Listenpreise deutlich höher ausfallen.
| Einsatzbereich | Preis-Leistungs-Sieger | Hauptgrund |
|---|---|---|
| Günstige Textverarbeitung | DeepSeek V4 Flash | niedrigster direkter Tokenpreis |
| EU-Projekte mit sensiblen Daten | Mistral Small 4 | EU-Hosting und offene Gewichte |
| Lange Kontexte und Werkzeuge | GPT-5.6 Luna | 1,05 Mio. Token und integrierte Tools |
| Bild, Video, Audio und PDF | Gemini 3.5 Flash-Lite | breiteste günstige Eingabeunterstützung |
| Komplexe Agenten und Coding | Claude Sonnet 5 | starkes Funktionspaket mit 1 Mio. Kontext |
| Enterprise-RAG | Cohere Command A oder Mistral Medium 3.5 | RAG-, Zitier- und Tool-Funktionen |
| Eigene Infrastruktur | Mistral Small 4 | Apache-2.0-Gewichte und lokaler Betrieb |
EU-Datenstandort verändert die Rangfolge
Die technische Verfügbarkeit einer API in Europa bedeutet noch keine garantierte Verarbeitung innerhalb der EU. Anbieter verwenden globale Endpunkte häufig für eine dynamische Lastverteilung. Unternehmen müssen Datenresidenz deshalb getrennt vom normalen API-Zugang bewerten.
Mistral besitzt im direkten Vergleich die klarste Ausgangslage. Kundendaten liegen standardmäßig in der Europäischen Union. Bestimmte Zusatzfunktionen können trotzdem Unterauftragnehmer außerhalb der EU einbeziehen. Enterprise-Kunden können einzelne Funktionen nach Rücksprache deaktivieren.
OpenAI bietet europäische Projekte mit regionaler Verarbeitung und ohne Speicherung von Modellanfragen an. Die Option gilt nur für geeignete Endpunkte und neue Projekte. Neue Modelle erhalten einen Preisaufschlag von zehn Prozent.
Google bietet mit Vertex AI EU-Endpunkte und einzelne europäische Regionen an. Globale Gemini-Endpunkte geben dagegen keine regionale Verarbeitungsgarantie. Auch bei Vertex hängt die Verfügbarkeit vom gewählten Modell und der jeweiligen Funktion ab.
Anthropic leitet Aufträge über die direkte API standardmäßig durch mehrere Weltregionen. Eine feste EU-Verarbeitung ist über geeignete Cloud-Endpunkte von Google oder AWS möglich. Regionale und multiregionale Endpunkte kosten zehn Prozent mehr als globale Zugriffe.
Meta Muse Spark 1.1 besitzt attraktive Preise für ein großes multimodales Agentenmodell. Der öffentliche Zugang ist am 31. Juli jedoch nur in den USA verfügbar. Eine direkte Einordnung als EU-Alternative wäre deshalb verfrüht.
xAI Grok 4.3 bietet ein Kontextfenster mit einer Million Token und einen niedrigen Outputpreis. Anfragen ab 200.000 Kontext-Token wechseln allerdings in den doppelten Tarif. Unternehmen sollten regionale Bereitstellung und Vertragsbedingungen für jedes Modell separat prüfen.
Cohere Command A kostet in der Beispielrechnung fünf Dollar. Der reine Tokenpreis wirkt hoch. Das Modell bietet dafür 256.000 Token Kontext, Bildverarbeitung, mehrsprachige Antworten, Tool-Aufrufe, strukturierte Ausgaben und integrierte Zitierfunktionen. RAG-Projekte können dadurch zusätzliche Entwicklungsarbeit sparen.
Offene Modelle bleiben eine weitere Alternative. Projekte wie Kimi K3 mit offenen Gewichten ermöglichen eigene Deployments. In diesem Fall entfallen API-Tokenpreise. GPU-Miete, Betrieb, Skalierung und Administration ersetzen jedoch die nutzungsabhängige Rechnung.
Der Juli-Vergleich liefert deshalb drei unterschiedliche Gewinner:
- DeepSeek V4 Flash gewinnt beim reinen Listenpreis.
- Mistral Small 4 gewinnt beim europäischen Gesamtpaket aus Preis, Hosting und Eigenbetrieb.
- Gemini 3.5 Flash-Lite gewinnt bei günstiger multimodaler Verarbeitung mit Audio und Video.
GPT-5.6 Luna bleibt die interessanteste günstige Wahl für sehr große Kontexte und integrierte Agentenwerkzeuge. Claude Sonnet 5 richtet sich an anspruchsvollere Coding- und Agentenaufgaben. Meta benötigt zunächst einen europäischen API-Start.
Der entscheidende Unternehmenswert bleibt der Preis pro erfolgreich abgeschlossener Aufgabe. Kleine Tests mit realen Dokumenten, Tools und Ausgabeformaten liefern deshalb eine bessere Entscheidungsgrundlage als der reine Preis pro Million Token.