Im Quellenvergleich
Alle Inhalte werden von KI erstellt. Dieser Überblick fasst zusammen, worin sich mehrere Quellen einig sind und worin sie sich unterscheiden — die Bewertung bleibt dir überlassen.
DeepSeek hat ein experimentelles Vision-Modell namens DeepSeek-V4-Flash-Vision-Exp veröffentlicht. Es erweitert das Modell DeepSeek-V4-Flash um Bildverarbeitung und behält dessen Textleistung bei Reasoning und Weltwissen. Laut DeepSeek erreicht die Vision-Variante in internen Benchmarks fast das Niveau von Claude Opus 4.8. Das Modell unterstützt die Formate JPEG, PNG, GIF und WebP. Entwickler können Bilder per Base64 einbetten oder über URLs bereitstellen (maximal 32 MiB) sowie die kostenlose Files-API nutzen. Der maximale Verbrauch liegt bei 384 Token pro Bild, die Abrechnung erfolgt zu V4-Flash-Preisen. Pro Request sind maximal 600 Bilder erlaubt. Das Modell ist für agentenbasierte Anwendungen gedacht und kann Bilder beschreiben, Text aus Screenshots extrahieren und Diagramme analysieren. Die Quellen berichten weitgehend übereinstimmend.