Im Quellenvergleich

KI-Ausgaben und Akzeptanz

2 Quellen · 2 Meldungen · Stand 06.07.2026

Alle Inhalte werden von KI erstellt. Dieser Überblick fasst zusammen, worin sich mehrere Quellen einig sind und worin sie sich unterscheiden — die Bewertung bleibt dir überlassen.

Im Quellenvergleich

Worin die Quellen übereinstimmen

Coinbase hat seine KI-Infrastruktur umgestellt, um Kosten zu senken. Das Unternehmen setzt auf chinesische Open-Source-Modelle wie GLM 5.2 und Kimi 2.7. Durch Maßnahmen wie dynamisches Routing und optimiertes Caching konnte Coinbase seine KI-Ausgaben halbieren, während die Token-Nutzung weiter stieg. Auch andere Unternehmen wie Snowflake und Lindy testen oder nutzen chinesische Modelle als günstigere Alternative. Die Kosten für Token-Verarbeitung bedrohen bei hoher Nutzerzahl die Margen. Chinesische Open-Weight-Modelle nähern sich der US-Spitze an. Microsoft präsentierte mit Foundry Local für Azure Local einen vLLM-Runtime mit automatischem Speicherplaner. NVIDIA und Microsoft kündigten den Superchip RTX Spark an. Das chinesische Modell GLM 5.2 von Zhipu AI erreichte im Codierungstest SWE-bench Pro 62,1 Punkte und übertraf damit GPT-5.5 (58,6).

Aktualisierungen
06.07.2026
Die Kosten für Token-Verarbeitung bedrohen bei hoher Nutzerzahl die Margen.
Chinesische Open-Weight-Modelle nähern sich der US-Spitze an.
Microsoft präsentierte mit Foundry Local für Azure Local einen vLLM-Runtime mit automatischem Speicherplaner.
NVIDIA und Microsoft kündigten den Superchip RTX Spark an.
Das chinesische Modell GLM 5.2 von Zhipu AI erreichte im Codierungstest SWE-bench Pro 62,1 Punkte und übertraf damit GPT-5.5 (58,6).
Worin sie sich unterscheidenBewertung der wirtschaftlichen Entwicklung der KI-Branche·Details zur Umstellung bei Coinbase·Nutzungsregelung für Entwickler bei Coinbase+3 weitere
Bewertung der wirtschaftlichen Entwicklung der KI-Branche
  • Die KI-Blase platzt nicht, aber die Wirtschaftlichkeit von LLMs wird für Unternehmen zum Problem.1
Details zur Umstellung bei Coinbase
  • Coinbase-CEO Brian Armstrong hat das Unternehmen auf chinesische Standard-KI-Modelle umgestellt.2
  • Coinbase setzt auf dynamisches Routing und optimiertes Caching, statt harte Limits zu verhängen.1
Nutzungsregelung für Entwickler bei Coinbase
  • Entwickler dürfen weiterhin jedes Modell nutzen, doch 91 Prozent hätten ihre bisherigen Nutzungslimits nie erreicht.2
Transparenz und Kontrolle des Token-Verbrauchs
  • Coinbase macht den Token-Verbrauch jedes Entwicklers sichtbar, ohne ihn zu begrenzen. Wer mehr ausgibt, muss mehr Wirkung nachweisen.2
Leistungsfähigkeit chinesischer Modelle
  • Einem ehemaligen Meta-Manager zufolge generiert GLM 5.2 alltagstauglichen Code. Ihr Kontextfenster umfasst eine Million Token, das API ist etwa zehnmal günstiger als teure Anthropic-Tarife. Die Effizienz erreicht sie durch Algorithmen wie DeepSeek Sparse Attention und Multi-Token Prediction. Die Lizenz ist MIT.1
Weitere technische Neuerungen im Juni
  • Microsoft präsentierte mit Foundry Local für Azure Local einen vLLM-Runtime mit automatischem Speicherplaner (vLLM Planner). Dieser inspiziert vor dem Start die GPU-Ressourcen und generiert die Konfiguration automatisch, um OOM-Fehler zu vermeiden. Die Plattform unterstützt PagedAttention und Continuous Batching.1
  • NVIDIA und Microsoft kündigten den Superchip RTX Spark an. Er soll mit 1 Petaflops (FP4) und 128 GB einheitlichem LPDDR5X-Speicher LLMs mit über 120 Milliarden Parametern und einem Millionen-Token-Kontext lokal auf Notebooks ermöglichen. NVIDIA portierte die CUDA-Ökosysteme nativ auf ARM.1

Quellen (2)

Vollständige Übersicht mit allen Meldungen öffnen →