Welche KI Modelle einsetzen
Vom Chatbot bis zur automatisierten Aktenprüfung: Wer pauschal zum teuersten Flaggschiff-Modell greift, verbrennt Budgets ohne messbaren Qualitätsvorteil. Ein strategischer Leitfaden zur Auswahl der passenden Sprachmodelle (LLMs), Routing-Architekturen und Kostenoptimierung.
Klasse A: Lightweight & High-Volume (z. B. Gemini Flash, GPT-4o mini, DeepSeek V3)
Eigenschaften: Extrem schnell (sub-sekündlich), unschlagbar günstig (unter 0,50 $/Mio. Tokens).
- Klassifizierung, Vorfilterung und Keyword-Extraktion
- Einfache RAG-Zusammenfassungen und FAQ-Chatbots
- Format-Transformationen (z. B. unstrukturierter Freitext in standardisiertes JSON)
- Intent-Erkennung für das vorgeschaltete Routing
Klasse B: Allrounder & Frontier Workhorses (z. B. Claude Sonnet, GPT-4o / GPT-4.1)
Eigenschaften: Ausgezeichnetes Textverständnis, nuancierter Schreibstil, exzellente Code-Generierung und Werkzeugnutzung (Function Calling).
- Komplexe Programmieraufgaben, Refactoring und Architekturberatung
- Agentische Workflows (Autonome Agenten mit Multi-Step Tool-Nutzung)
- Redaktionelle Contenterstellung, anspruchsvolle Übersetzungen und Fachanalysen
- Verarbeitung langer juristischer oder technischer Dokumente
Klasse C: Reasoning & Deep-Logic Modelle (z. B. OpenAI o3/o4-mini, o1, DeepSeek R1)
Eigenschaften: Nutzen „Test-Time Compute“ (denken vor dem Antworten Schritt für Schritt nach), erzeugen Thinking-Tokens, hohe Rechenzeit.
- Mathematische Beweise, statistische Modellierung und Datenvalidierung
- Fehlersuche in komplexen Codebases und Sicherheitsaudits
- Vieldimensionale logische Abgleiche (z. B. steuerrechtliche oder regulatorische Prüfungen)
Wichtig: Der Output (Antwortgenerierung) ist in der Regel um den Faktor 3 bis 8 teurer als der Input (Prompt + Kontext).
| Anbieter | Modell | Kategorie | Input / 1M Tokens | Cached Input / 1M | Output / 1M Tokens | Batch-Rabatt | Typischer Einsatzzweck |
|---|---|---|---|---|---|---|---|
| OpenAI | GPT-4o mini | Budget | 0,15 $ | 0,075 $ | 0,60 $ | 50 % | Klassifikation, Routing, High-Volume FAQ, JSON-Extraktion |
| OpenAI | GPT-4o | Workhorse | 2,50 $ | 1,25 $ | 10,00 $ | 50 % | Multimodalität (Audio/Bild), Standard-Agenten, Redaktion |
| OpenAI | GPT-4.5 / Frontier | Flagship | 75,00 $ | 37,50 $ | 150,00 $ | 50 % | High-End Synthese, kreative Spitzenleistungen, Forschung |
| OpenAI | o3-mini / o4-mini | Reasoning | 1,10 $ | 0,55 $ | 4,40 $ | 50 % | Schnelles Math/Coding-Reasoning, STEM, Logikprüfungen |
| OpenAI | o1 | Deep Reasoning | 15,00 $ | 7,50 $ | 60,00 $ | 50 % | Schwere Logikaufgaben, komplexe Sicherheitsaudits, Beweise |
| Anthropic | Claude 3.5 Haiku | Budget | 0,80 $ | 0,08 $ | 4,00 $ | 50 % | Schnelle APIs, strukturierter Output, Leichtgewicht-Support |
| Anthropic | Claude 3.5 / 3.7 Sonnet | Workhorse | 3,00 $ | 0,30 $ | 15,00 $ | 50 % | Coding-Benchmark-Leader, agentische Workflows, lange Kontexte |
| Anthropic | Claude 3 Opus | Flagship | 15,00 $ | 1,50 $ | 75,00 $ | 50 % | Nuancierte Textanalysen, philosophische & komplexe juristische Fragen |
| Gemini 2.0 / 2.5 Flash | Budget | 0,10 $ | 0,025 $ | 0,40 $ | 50 % | Sub-Sekunden-Latenz, multimodale Pipelines, 1M+ Kontextfenster | |
| Gemini 2.0 Flash Thinking | Reasoning | 0,15 $ | 0,0375 $ | 0,60 $ | 50 % | Kostengünstiges Multimodal-Reasoning & Schritt-für-Schritt-Logik | |
| Gemini 1.5 / 2.5 Pro | Workhorse | 1,25 $ (≤128k) 2,50 $ (>128k) | 0,31 $ | 5,00 $ (≤128k) 10,00 $ (>128k) | 50 % | Riesige Kontextfenster (bis 2M Tokens), komplexe Video-/Audioanalyse | |
| DeepSeek | DeepSeek V3 | Open-Weights | 0,14 $ (API) | 0,014 $ | 0,28 $ | — | Massenverarbeitung mit Flagship-Leistung zum Bruchteil des Preises |
| DeepSeek | DeepSeek R1 | Reasoning | 0,55 $ (API) | 0,14 $ | 2,19 $ | — | Open-Source-Reasoning auf o1-Niveau, lokale Deployments |
| Mistral | Mistral NeMo (12B) | Budget / Edge | 0,15 $ | — | 0,15 $ | — | Lokal auf Edge-Devices / Workstations, günstige Klassifikation |
| Mistral | Codestral (22B) | Code Spezial | 0,30 $ | — | 0,90 $ | — | Code-Completion (FIM), IDE-Integrationen, dediziertes Coding |
| Mistral | Mistral Small (24B) | Workhorse | 0,20 $ | — | 0,60 $ | — | Kompakter europäischer Allrounder, DSGVO-konforme Enterprise-Pipelines |
| Mistral | Mistral Large (2411) | Flagship | 2,00 $ | — | 6,00 $ | — | Enterprise RAG, mehrsprachige Synthese, europäischer Datenschutzfokus |
| Meta / Gehostet | Llama 3.1 / 3.3 70B | Open-Weights | 0,50 $ – 0,80 $ | Providerabh. | 0,75 $ – 1,20 $ | — | Sehr starker Open-Source-Allrounder, vollständig on-prem hostbar |
| Meta / Gehostet | Llama 3.1 405B | Open-Weights Big | 1,80 $ – 3,50 $ | Providerabh. | 1,80 $ – 3,50 $ | — | Synthetic Data Generation, Distillation für kleinere Modelle |
| Cohere | Command R | RAG Workhorse | 0,15 $ | — | 0,60 $ | — | Enterprise RAG, Connector-Integrationen, Zitationen |
| Cohere | Command R+ | Enterprise RAG | 2,50 $ | — | 10,00 $ | — | Multi-Step Tool Use, komplexe Unternehmenssuche mit Quellenverweisen |
Angenommen, ein Unternehmen verarbeitet monatlich 100.000 Kundenanfragen (durchschnittlich je 1.000 Input-Tokens Kontext und 300 Output-Tokens Antwort):
- Szenario 1: Pauschaler Einsatz eines Flaggschiffs (Claude Sonnet 3.5 / 4):
Input: 100 Mio. Tokens × 3,00 $ = 300 $
Output: 30 Mio. Tokens × 15,00 $ = 450 $
Gesamtkosten: ~750 $ pro Monat - Szenario 2: Einsatz eines schlanken Modells (Gemini Flash / GPT-4o mini):
Input: 100 Mio. Tokens × 0,15 $ = 15 $
Output: 30 Mio. Tokens × 0,60 $ = 18 $
Gesamtkosten: ~33 $ pro Monat (Ersparnis: über 95 %)
- Modell-Routing etablieren (Cascading LLMs): Ein ultra-günstiges Modell (oder Regex/Vektorsuche) prüft die Benutzeranfrage. Routineanfragen werden direkt beantwortet; nur bei komplexen Codier-, Logik- oder Rechtsfragen wird die Anfrage an Sonnet oder ein Reasoning-Modell weitergeleitet.
- Prompt Caching nutzen: Nahezu alle großen Provider (OpenAI, Anthropic, Google) bieten drastische Rabatte (bis zu 80–90 % auf Input-Tokens), wenn System-Prompts, Dokumenten-Kontexte oder Bibliotheken unverändert wiederverwendet werden.
- Batch-API für asynchrone Jobs: Benötigt eine Verarbeitung keine Echtzeitantwort (z. B. nächtliche Indexierung, Archiv-Analysen), halbiert der Batch-Modus die API-Kosten um 50 %.
- Self-Hosting prüfen (Open-Weights): Bei extrem hohem, kontinuierlichem Volumen oder strengsten Datenschutzanforderungen (DSGVO/Geheimschutz) lohnt das Hosting offener Modelle (Llama, Mistral, Qwen) auf dedizierten Cloud-GPUs (H100/A100) oder lokaler Hardware. Bei niedriger oder unregelmäßiger Last ist die Serverless-Cloud-API jedoch fast immer rentabler.