Welche KI Modelle einsetzen

Vom Chatbot bis zur automatisierten Aktenprüfung: Wer pauschal zum teuersten Flaggschiff-Modell greift, verbrennt Budgets ohne messbaren Qualitätsvorteil. Ein strategischer Leitfaden zur Auswahl der passenden Sprachmodelle (LLMs), Routing-Architekturen und Kostenoptimierung.

Die Faustformel: Drei Modellklassen für unterschiedliche AufgabenIn modernen IT- und Software-Architekturen kommt fast nie nur ein einziges Modell zum Einsatz. Stattdessen wird nach Rechenintensität, Latenz und logischer Tiefe segmentiert:

Klasse A: Lightweight & High-Volume (z. B. Gemini Flash, GPT-4o mini, DeepSeek V3)

Eigenschaften: Extrem schnell (sub-sekündlich), unschlagbar günstig (unter 0,50 $/Mio. Tokens).

  • Klassifizierung, Vorfilterung und Keyword-Extraktion
  • Einfache RAG-Zusammenfassungen und FAQ-Chatbots
  • Format-Transformationen (z. B. unstrukturierter Freitext in standardisiertes JSON)
  • Intent-Erkennung für das vorgeschaltete Routing

Klasse B: Allrounder & Frontier Workhorses (z. B. Claude Sonnet, GPT-4o / GPT-4.1)

Eigenschaften: Ausgezeichnetes Textverständnis, nuancierter Schreibstil, exzellente Code-Generierung und Werkzeugnutzung (Function Calling).

  • Komplexe Programmieraufgaben, Refactoring und Architekturberatung
  • Agentische Workflows (Autonome Agenten mit Multi-Step Tool-Nutzung)
  • Redaktionelle Contenterstellung, anspruchsvolle Übersetzungen und Fachanalysen
  • Verarbeitung langer juristischer oder technischer Dokumente

Klasse C: Reasoning & Deep-Logic Modelle (z. B. OpenAI o3/o4-mini, o1, DeepSeek R1)

Eigenschaften: Nutzen „Test-Time Compute“ (denken vor dem Antworten Schritt für Schritt nach), erzeugen Thinking-Tokens, hohe Rechenzeit.

  • Mathematische Beweise, statistische Modellierung und Datenvalidierung
  • Fehlersuche in komplexen Codebases und Sicherheitsaudits
  • Vieldimensionale logische Abgleiche (z. B. steuerrechtliche oder regulatorische Prüfungen)
Der Kostenfaktor: API-Token-Preise im MarktvergleichBei APIs wird nach Tokens abgerechnet (1 Token ≈ 0,75 Wörter im Englischen bzw. ca. 0,5–0,6 Wörter im Deutschen).
Wichtig: Der Output (Antwortgenerierung) ist in der Regel um den Faktor 3 bis 8 teurer als der Input (Prompt + Kontext).

 

AnbieterModellKategorieInput / 1M TokensCached Input / 1MOutput / 1M TokensBatch-RabattTypischer Einsatzzweck
OpenAIGPT-4o miniBudget0,15 $0,075 $0,60 $50 %Klassifikation, Routing, High-Volume FAQ, JSON-Extraktion
OpenAIGPT-4oWorkhorse2,50 $1,25 $10,00 $50 %Multimodalität (Audio/Bild), Standard-Agenten, Redaktion
OpenAIGPT-4.5 / FrontierFlagship75,00 $37,50 $150,00 $50 %High-End Synthese, kreative Spitzenleistungen, Forschung
OpenAIo3-mini / o4-miniReasoning1,10 $0,55 $4,40 $50 %Schnelles Math/Coding-Reasoning, STEM, Logikprüfungen
OpenAIo1Deep Reasoning15,00 $7,50 $60,00 $50 %Schwere Logikaufgaben, komplexe Sicherheitsaudits, Beweise
AnthropicClaude 3.5 HaikuBudget0,80 $0,08 $4,00 $50 %Schnelle APIs, strukturierter Output, Leichtgewicht-Support
AnthropicClaude 3.5 / 3.7 SonnetWorkhorse3,00 $0,30 $15,00 $50 %Coding-Benchmark-Leader, agentische Workflows, lange Kontexte
AnthropicClaude 3 OpusFlagship15,00 $1,50 $75,00 $50 %Nuancierte Textanalysen, philosophische & komplexe juristische Fragen
GoogleGemini 2.0 / 2.5 FlashBudget0,10 $0,025 $0,40 $50 %Sub-Sekunden-Latenz, multimodale Pipelines, 1M+ Kontextfenster
GoogleGemini 2.0 Flash ThinkingReasoning0,15 $0,0375 $0,60 $50 %Kostengünstiges Multimodal-Reasoning & Schritt-für-Schritt-Logik
GoogleGemini 1.5 / 2.5 ProWorkhorse1,25 $ (≤128k)
2,50 $ (>128k)
0,31 $5,00 $ (≤128k)
10,00 $ (>128k)
50 %Riesige Kontextfenster (bis 2M Tokens), komplexe Video-/Audioanalyse
DeepSeekDeepSeek V3Open-Weights0,14 $ (API)0,014 $0,28 $—Massenverarbeitung mit Flagship-Leistung zum Bruchteil des Preises
DeepSeekDeepSeek R1Reasoning0,55 $ (API)0,14 $2,19 $—Open-Source-Reasoning auf o1-Niveau, lokale Deployments
MistralMistral NeMo (12B)Budget / Edge0,15 $—0,15 $—Lokal auf Edge-Devices / Workstations, günstige Klassifikation
MistralCodestral (22B)Code Spezial0,30 $—0,90 $—Code-Completion (FIM), IDE-Integrationen, dediziertes Coding
MistralMistral Small (24B)Workhorse0,20 $—0,60 $—Kompakter europäischer Allrounder, DSGVO-konforme Enterprise-Pipelines
MistralMistral Large (2411)Flagship2,00 $—6,00 $—Enterprise RAG, mehrsprachige Synthese, europäischer Datenschutzfokus
Meta / GehostetLlama 3.1 / 3.3 70BOpen-Weights0,50 $ – 0,80 $Providerabh.0,75 $ – 1,20 $—Sehr starker Open-Source-Allrounder, vollständig on-prem hostbar
Meta / GehostetLlama 3.1 405BOpen-Weights Big1,80 $ – 3,50 $Providerabh.1,80 $ – 3,50 $—Synthetic Data Generation, Distillation für kleinere Modelle
CohereCommand RRAG Workhorse0,15 $—0,60 $—Enterprise RAG, Connector-Integrationen, Zitationen
CohereCommand R+Enterprise RAG2,50 $—10,00 $—Multi-Step Tool Use, komplexe Unternehmenssuche mit Quellenverweisen

Angenommen, ein Unternehmen verarbeitet monatlich 100.000 Kundenanfragen (durchschnittlich je 1.000 Input-Tokens Kontext und 300 Output-Tokens Antwort):

  • Szenario 1: Pauschaler Einsatz eines Flaggschiffs (Claude Sonnet 3.5 / 4):
    Input: 100 Mio. Tokens × 3,00 $ = 300 $
    Output: 30 Mio. Tokens × 15,00 $ = 450 $
    Gesamtkosten: ~750 $ pro Monat
  • Szenario 2: Einsatz eines schlanken Modells (Gemini Flash / GPT-4o mini):
    Input: 100 Mio. Tokens × 0,15 $ = 15 $
    Output: 30 Mio. Tokens × 0,60 $ = 18 $
    Gesamtkosten: ~33 $ pro Monat (Ersparnis: über 95 %)
So optimieren Sie Kosten und Architektur

  1. Modell-Routing etablieren (Cascading LLMs): Ein ultra-günstiges Modell (oder Regex/Vektorsuche) prüft die Benutzeranfrage. Routineanfragen werden direkt beantwortet; nur bei komplexen Codier-, Logik- oder Rechtsfragen wird die Anfrage an Sonnet oder ein Reasoning-Modell weitergeleitet.
  2. Prompt Caching nutzen: Nahezu alle großen Provider (OpenAI, Anthropic, Google) bieten drastische Rabatte (bis zu 80–90 % auf Input-Tokens), wenn System-Prompts, Dokumenten-Kontexte oder Bibliotheken unverändert wiederverwendet werden.
  3. Batch-API für asynchrone Jobs: Benötigt eine Verarbeitung keine Echtzeitantwort (z. B. nächtliche Indexierung, Archiv-Analysen), halbiert der Batch-Modus die API-Kosten um 50 %.
  4. Self-Hosting prüfen (Open-Weights): Bei extrem hohem, kontinuierlichem Volumen oder strengsten Datenschutzanforderungen (DSGVO/Geheimschutz) lohnt das Hosting offener Modelle (Llama, Mistral, Qwen) auf dedizierten Cloud-GPUs (H100/A100) oder lokaler Hardware. Bei niedriger oder unregelmäßiger Last ist die Serverless-Cloud-API jedoch fast immer rentabler.