
DeepSeek hat am 10. September 2026 V4.1-Flash veröffentlicht, und die Botschaft ist unmissverständlich: Agenten-Leistung auf Flaggschiff-Niveau, native Bildverständnis und eine Preistabelle, die aktuelle Top-Modelle wie Luxusartikel aussehen lässt. Das Modell läuft als deepseek-flash auf der DeepSeek-API, die Open-Source-Gewichte und der Tech-Report liegen bereits auf Hugging Face – und es verdrängt den eigenen Flaggschiff-Kollegen: Ab dem 14. September werden alle V4-Pro-Anfragen an V4.1-Flash weitergeleitet.
V4.1-Flash ist kein weiteres Point-Release der V4-Linie. Es ist das kleinste Mitglied einer völlig neuen Architekturfamilie: ein Mixture-of-Experts mit 552 Milliarden Parametern auf Basis dessen, was DeepSeek einen Causal Encoder–Decoder nennt – mit einer ungewöhnlich asymmetrischen Aufteilung: rund 8B aktive Parameter für die Eingabeverarbeitung und 16B für die Ausgabe.
Zwei Dinge machen dieses Release mehr als einen Spezifikationssprung:

Bild: DeepSeeks offizielle Agent-Benchmark-Ergebnisse vom 10. September 2026.
In DeepSeeks veröffentlichter Vergleichstabelle schlägt V4.1-Flash nicht nur das eigene Pro-Modell, sondern mehrere Flaggschiffe genau bei den Aufgaben, die Agenten wirklich erledigen:
| Benchmark | V4.1-Flash | V4-Pro (0813) | Claude Opus 5 | GPT5.6-Sol |
|---|---|---|---|---|
| DeepSWE v1.1 | 74,2 | 62,7 | 74,0 | 73,0 |
| CyberGym | 88,1 | 83,3 | – | 84,5 |
| Automation-Bench | 54,8 | 43,2 | 50,3 | 45,8 |
| Terminal-Bench 3.0 | 30,0 | 11,8 | 43,3 | 34,4 |
| Codeforces (Rating) | 3471 | 3348 | – | – |
Der ehrliche Vorbehalt: Bei reinen Wissens-Benchmarks liegen die etablierten Flaggschiffe vorn. GPQA Diamond liegt bei 90,9 (GPT5.6-Sol: 94,1), der HLE-Wert von 36,8 reicht nicht an Opus 5 mit 56,3 heran. V4.1-Flash konkurriert dort, wo Code, Terminal und mehrstufige Agentenarbeit leben – und gewinnt dort meistens.

Bild: DeepSeeks vollständige offizielle Benchmark-Vergleichstabelle.

Bild: DeepSeek-V4.1-Flash-API-Preise, gültig ab 04:00 UTC am 10. September 2026.
In der Off-Peak-Zeit zahlen Sie 0,15 $ pro Million Input-Token und 0,60 $ pro Million Output-Token – und „Off-Peak" umfasst alles außer 01:00–04:00 und 06:00–10:00 UTC an Werktagen; Wochenenden und Feiertage sind durchgehend Off-Peak. Bei Cache-Treffern sinken die Input-Kosten auf 0,003 $ pro Million Token – die Zahl, die für Agent-Workloads zählt, die den gleichen Kontext den ganzen Tag immer wieder lesen.
Die Community hat bereits nachgerechnet: Ein beliebter Thread auf r/singularity berichtet, V4.1-Flash erreiche auf dem OpenDesign Arena 98 % des Scores von GPT-6 „Astra" bei 1,4 % der Kosten.

Bild: KV-Cache pro Token über vier Modellgenerationen von DeepSeek.
Die Serving-Kosten sind der stille Burggraben. DeepSeek hat den KV-Cache pro Token von 389.120 Bytes (V1, 2023) auf 890 Bytes komprimiert, und die Architektur von V4.1-Flash reduziert HBM auf ein Viertel und SSD auf ein Achtel des Vorgängers. Billiger Cache ist der Grund, warum ein Cache-Hit-Preis von 0,003 $ wirtschaftlich funktioniert und nicht nur Marketing ist.
Der kühnste Teil der Ankündigung steht in einem winzigen Absatz: Ab dem 14. September, 04:00 UTC, werden alle V4-Pro-Anfragen zu V4.1-Flash-Preisen an V4.1-Flash weitergeleitet, bis ein V4.1-Pro erscheint. Die alten Modellnamen V4-Flash und V4-Flash-Vision-Exp leiten bereits weiter. DeepSeek hält kein Premium-Tier aus Nostalgie am Leben – das Flash-Tier ist inzwischen die Strategie.
Der Hacker-News-Thread zur V4-Flash-Linie fängt beide Lager ein. Fans betonen: „DSV4-Modelle sind extrem günstig zu servieren. Ihre Verbesserung hat viele Downstream-Effekte." Skeptiker halten entgegen, dass billige Token nicht effiziente Token sind – „Sie können DeepSeek eine Stunde an einer harten Aufgabe werken lassen oder Opus fünf Minuten" – und Stresstests des 1M-Kontexts der V4-Linie zeigen Qualitätsverlust bei sehr großen Repositories. Beides stimmt: V4.1-Flash bietet spektakulären Wert pro Token, ob sich dieser Wert realisiert, entscheidet das Token-Budget Ihres Agenten.
Das Modell läuft als deepseek-flash auf der DeepSeek-API (alte Modellnamen werden während der Übergangszeit weitergeleitet). Open-Source-Gewichte und Tech-Report gibt es auf Hugging Face, und die Partner CodeBuddy (via WorkBuddy) und OpenCode unterstützen das Modell seit dem ersten Tag.
Sorgfältig ausgewählte KI -Tools zur Verbesserung Ihrer Arbeit, Ihres Studiums und Ihrer Live -Effizienz.
Wenn wir heute, im Jahr 2025, auf die Entwicklung der künstlichen Intelligenz zurückblicken, können wir sehen, wie diese revolutionäre Technologie jeden Aspekt der menschlichen Gesellschaft umgestaltet hat. Von den ersten theoretischen Konzepten bis hin zu den heutigen praktischen Anwendungen hat jeder Fortschritt in der KI-Technologie unser Leben verändert. Lassen Sie uns diese faszinierende Reise gemeinsam Revue passieren.
In den Jahren 2024 und Anfang 2025 hat das Feld der künstlichen Intelligenz (KI) bedeutende Fortschritte gemacht, die sich auf verschiedene Bereiche auswirken. KI-Modelle haben in verschiedenen Benchmark-Tests beeindruckende Leistungssteigerungen gezeigt, was eine neue Stufe ihrer Fähigkeiten zur Bewältigung komplexer Aufgaben markiert <sup>[1]</sup>. Von der Gesundheitsversorgung bis zum Transportwesen durchdringt KI den Alltag in bisher ungekannter Geschwindigkeit <sup>[1]</sup>. Auch in der Wirtschaft zeigt die Übernahme und Investition in KI ein starkes Wachstum, insbesondere im Bereich der generativen KI <sup>[1]</sup>. Die USA bleiben bei der Entwicklung von KI-Modellen führend, doch China holt schnell bei der Qualität auf <sup>[1]</sup>. Gleichzeitig entwickelt sich ein verantwortungsvolles KI-Ökosystem weiter, wobei ethische Überlegungen und Regulierung zunehmend an Bedeutung gewinnen <sup>[1]</sup>. Weltweit ist die allgemeine Zuversicht in Bezug auf KI gestiegen, auch wenn zwischen verschiedenen Regionen weiterhin Unterschiede bestehen <sup>[1]</sup>.
Sponsored byCircle Crop Image