Im Quellenvergleich
Worin die Quellen übereinstimmen
Coinbase hat seine KI-Infrastruktur umgestellt, um Kosten zu senken. Das Unternehmen setzt auf chinesische Open-Source-Modelle wie GLM 5.2 und Kimi 2.7. Durch Maßnahmen wie dynamisches Routing und optimiertes Caching konnte Coinbase seine KI-Ausgaben halbieren, während die Token-Nutzung weiter stieg. Auch andere Unternehmen wie Snowflake und Lindy testen oder nutzen chinesische Modelle als günstigere Alternative. Die Kosten für Token-Verarbeitung bedrohen bei hoher Nutzerzahl die Margen. Chinesische Open-Weight-Modelle nähern sich der US-Spitze an. Microsoft präsentierte mit Foundry Local für Azure Local einen vLLM-Runtime mit automatischem Speicherplaner. NVIDIA und Microsoft kündigten den Superchip RTX Spark an. Das chinesische Modell GLM 5.2 von Zhipu AI erreichte im Codierungstest SWE-bench Pro 62,1 Punkte und übertraf damit GPT-5.5 (58,6).
Aktualisierungen
06.07.2026
Die Kosten für Token-Verarbeitung bedrohen bei hoher Nutzerzahl die Margen.
Chinesische Open-Weight-Modelle nähern sich der US-Spitze an.
Microsoft präsentierte mit Foundry Local für Azure Local einen vLLM-Runtime mit automatischem Speicherplaner.
NVIDIA und Microsoft kündigten den Superchip RTX Spark an.
Das chinesische Modell GLM 5.2 von Zhipu AI erreichte im Codierungstest SWE-bench Pro 62,1 Punkte und übertraf damit GPT-5.5 (58,6).
Worin sie sich unterscheidenBewertung der wirtschaftlichen Entwicklung der KI-Branche·Details zur Umstellung bei Coinbase·Nutzungsregelung für Entwickler bei Coinbase+3 weitere
Bewertung der wirtschaftlichen Entwicklung der KI-Branche- Die KI-Blase platzt nicht, aber die Wirtschaftlichkeit von LLMs wird für Unternehmen zum Problem.1
Details zur Umstellung bei Coinbase- Coinbase-CEO Brian Armstrong hat das Unternehmen auf chinesische Standard-KI-Modelle umgestellt.2
- Coinbase setzt auf dynamisches Routing und optimiertes Caching, statt harte Limits zu verhängen.1
Nutzungsregelung für Entwickler bei Coinbase- Entwickler dürfen weiterhin jedes Modell nutzen, doch 91 Prozent hätten ihre bisherigen Nutzungslimits nie erreicht.2
Transparenz und Kontrolle des Token-Verbrauchs- Coinbase macht den Token-Verbrauch jedes Entwicklers sichtbar, ohne ihn zu begrenzen. Wer mehr ausgibt, muss mehr Wirkung nachweisen.2
Leistungsfähigkeit chinesischer Modelle- Einem ehemaligen Meta-Manager zufolge generiert GLM 5.2 alltagstauglichen Code. Ihr Kontextfenster umfasst eine Million Token, das API ist etwa zehnmal günstiger als teure Anthropic-Tarife. Die Effizienz erreicht sie durch Algorithmen wie DeepSeek Sparse Attention und Multi-Token Prediction. Die Lizenz ist MIT.1
Weitere technische Neuerungen im Juni- Microsoft präsentierte mit Foundry Local für Azure Local einen vLLM-Runtime mit automatischem Speicherplaner (vLLM Planner). Dieser inspiziert vor dem Start die GPU-Ressourcen und generiert die Konfiguration automatisch, um OOM-Fehler zu vermeiden. Die Plattform unterstützt PagedAttention und Continuous Batching.1
- NVIDIA und Microsoft kündigten den Superchip RTX Spark an. Er soll mit 1 Petaflops (FP4) und 128 GB einheitlichem LPDDR5X-Speicher LLMs mit über 120 Milliarden Parametern und einem Millionen-Token-Kontext lokal auf Notebooks ermöglichen. NVIDIA portierte die CUDA-Ökosysteme nativ auf ARM.1