Eliminierung technischer Schulden mit PHPStan, Rector PHP und PHPUnit. Über 20 Jahre Praxiserfahrung in skalierbaren Backends.
- Aktualisiert:
- Autor:
- Roland Golla
Was ist DeepSeek Coding?
DeepSeek Coding bezeichnet die Open Source KI Modelle des chinesischen Unternehmens DeepSeek AI für Code Generierung, Debugging und Reasoning. Seit April 2026 besteht die Familie aus DeepSeek V4-Pro und DeepSeek V4-Flash, beide mit einer Million Token Kontext und offenen Gewichten unter MIT Lizenz.
Die Architektur ist eine Mixture of Experts. V4-Pro hat 1,6 Billionen Parameter, aktiv sind pro Token nur 49 Milliarden. V4-Flash kommt auf 284 Milliarden gesamt und 13 Milliarden aktiv. Dazu ein neues Attention Verfahren aus Token Kompression und DeepSeek Sparse Attention. Das drückt Rechenlast und Speicherbedarf bei langem Kontext massiv.
Am 31. Juli 2026 kam das offizielle V4-Flash Release, intern V4-Flash-0731. Gleiche Architektur, gleiche Größe, nur neu post trainiert. Die Kernfrage für Teams in Europa bleibt trotzdem dieselbe: Die Cloud API überträgt Daten nach China. Wer DeepSeek sauber einsetzen will, hostet selbst.
Inhalt
DeepSeek mit NCA: Schnelle Hilfe vom Experten
Never Code Alone sitzt in Duisburg und arbeitet seit über 20 Jahren an Softwarequalität. Roland Golla ist Cypress Ambassador, hat zum TYPO3 Core beigetragen und spricht auf Konferenzen wie der code.talks und der International PHP Conference. Offene Modelle sind bei uns kein Trendthema: Wir betreiben lokale Inferenz über Ollama, prüfen neue Releases im echten Projekt und wissen, wo der Unterschied zwischen Benchmark und Alltag liegt.
Passend dazu unsere Leistungen: Vibe Coding Consulting für den Aufbau kontrollierter KI Infrastruktur, Vibe Coding Training für ganze Teams, CI/CD Pipelines die KI generierten Code automatisch prüfen, PHP Consulting für gewachsene Symfony Systeme und Vibe Coding Modelle als laufend gepflegter Überblick. Ein kostenloses Kennenlernen klärt in wenigen Minuten, ob wir passen, abgerechnet wird danach minutengenau.
DeepSeek sauber aufsetzen statt raten
Finde das passende Angebot für dein Projekt
Anfrage-Konfiguration
Starten Sie Ihre Anfrage
Gesetzliche Konformität & Inklusion. Optimierung von Performance und Conversion durch radikal nutzerzentriertes, universelles Design.
Skalierbare KI-Systeme mit echtem Code Ownership. CI/CD, Backup-Strategien und Infrastruktur, die mit deinem Team wächst.
Anfrage-Konfiguration
Worauf liegt dein Fokus?
Wähle die Expertise, die dein Projekt jetzt am dringendsten benötigt.
Die DeepSeek Modellfamilie 2026: V4-Pro und V4-Flash
DeepSeek hat im April 2026 einen harten Schnitt gemacht. Statt einzelner Spezialmodelle wie früher Coder V2, V3 und R1 gibt es jetzt zwei Modelle, die alles abdecken: Chat, Code und Reasoning. Beide laufen mit einer Million Token Kontext, beide beherrschen Thinking und Non Thinking Modus.
DeepSeek V4-Pro ist das Flaggschiff. 1,6 Billionen Parameter gesamt, 49 Milliarden aktiv pro Token. DeepSeek positioniert es als offenen Spitzenreiter bei agentischem Coding, Mathematik und STEM Reasoning. In der API steht es Stand August 2026 weiterhin als Preview, das offizielle Release ist angekündigt.
DeepSeek V4-Flash ist das kleine, schnelle Modell. 284 Milliarden gesamt, 13 Milliarden aktiv. Genau dieses Modell hat am 31. Juli 2026 sein offizielles Release bekommen. Der Build V4-Flash-0731 ist architektonisch identisch mit dem Preview vom April, wurde aber komplett neu post trainiert.
Und was ist mit Coder V2, V3 und R1? Die sind Geschichte. R1 hat im Januar 2025 die ganze Branche wachgerüttelt, Coder V2 war lange das dedizierte Code Modell mit 338 Sprachen. Für neue Projekte spielen beide keine Rolle mehr. Wer heute mit DeepSeek arbeitet, arbeitet mit V4. Ein Blick auf die Konkurrenz lohnt trotzdem: GLM 5.2, Kimi K3 und Qwen3 Coder spielen in derselben Liga.
Die offenen Gewichte liegen auf Hugging Face unter MIT Lizenz. Wichtig für die Praxis: Der 0731 Build ist bisher nur über die API erreichbar. Zum Herunterladen gibt es weiterhin die Preview Gewichte vom April. Wer echte Kontrolle über sein Modell will, muss diesen Unterschied kennen. Mehr Einordnung dazu im Überblick zu chinesischen KI Modellen für AI Coding.
DeepSeek API Preise pro Million Token, Stand 31. Juli 2026
| Position | deepseek-v4-flash | deepseek-v4-pro |
|---|---|---|
| Input, Cache Hit | 0,0028 USD | 0,003625 USD |
| Input, Cache Miss | 0,14 USD | 0,435 USD |
| Output | 0,28 USD | 0,87 USD |
| Kontext | 1 Million Token | 1 Million Token |
| Maximaler Output | 384K Token | 384K Token |
| Parallele Anfragen | 2500 | 500 |
Migration: deepseek-chat und deepseek-reasoner sind abgeschaltet
Das ist der Punkt, der 2026 die meisten Integrationen zerlegt hat. DeepSeek hat die beiden alten API Namen am 24. Juli 2026 endgültig abgeschaltet. Wer sie noch aufruft, bekommt keine Antwort mehr, sondern einen Fehler. Übergangsweise zeigten sie auf V4-Flash, jetzt sind sie weg.
Die gute Nachricht: Der Umbau ist trivial. Die base_url bleibt, es ändert sich nur der Modellname. DeepSeek unterstützt sowohl das OpenAI ChatCompletions Format als auch die Anthropic Schnittstelle.
# Alt, seit dem 24. Juli 2026 tot
model = "deepseek-chat" # war Non Thinking Modus
model = "deepseek-reasoner" # war Thinking Modus
# Neu
model = "deepseek-v4-flash" # klein, schnell, guenstig
model = "deepseek-v4-pro" # Flaggschiff
# base_url bleibt unveraendert
# OpenAI Format: https://api.deepseek.com
# Anthropic Format: https://api.deepseek.com/anthropic
Ein Detail lohnt die Aufmerksamkeit: Thinking und Non Thinking sind jetzt kein eigenes Modell mehr, sondern ein Modus innerhalb desselben Modells. Wer bisher zwischen zwei Namen umgeschaltet hat, schaltet künftig einen Parameter um. Für agentische Setups ist das sauberer, weil der Kontext im Modell bleibt.
V4-Flash 0731: Wenn das kleine Modell das große schlägt
Der Sprung im Juli Build ist die eigentliche Nachricht. DeepSeek hat an der Architektur nichts geändert, nur neu trainiert. Und meldet auf allen neun veröffentlichten Agent und Coding Benchmarks bessere Werte als beim eigenen, deutlich größeren V4-Pro-Preview. Ein 284 Milliarden Modell schlägt sein 1,6 Billionen Geschwistermodell.
Der auffälligste Wert ist Terminal Bench 2.1. Dort springt V4-Flash von 61,8 im Preview auf 82,7. V4-Pro-Preview lag bei 72,1. Bei DeepSWE geht es von 7,3 auf 54,4, also mehr als das Siebenfache in einem einzigen Post Training Zyklus.
Wichtiger Vorbehalt. Alle diese Zahlen kommen von DeepSeek selbst, gemessen auf einer eigenen Harness, die noch nicht veröffentlicht ist. Zwei der neun Benchmarks sind interne Testsets des Unternehmens. Zum Zeitpunkt der Ankündigung hatte kein unabhängiges Labor die Werte reproduziert. Wir behandeln sie als Herstellerangabe, nicht als Messung.
Was unabhängig von Benchmarks bleibt, ist der Preis. Selbst wenn die Werte um zehn Punkte danebenliegen, verschiebt sich die Rechnung für agentische Workflows. Wer zehn Iterationen für den Preis einer einzigen fahren kann, arbeitet anders. Genau das ist der Kern von Vibe Coding. Neu im 0731 Build sind außerdem native Unterstützung für das Responses API Format und eine Anpassung an Codex.
Agent Benchmarks V4-Flash-0731 laut DeepSeek
| Benchmark | V4-Flash-0731 | Einordnung |
|---|---|---|
| Terminal Bench 2.1 | 82,7 | Preview lag bei 61,8, V4-Pro-Preview bei 72,1 |
| DeepSWE | 54,4 | Preview lag bei 7,3, mehr als das Siebenfache |
| NL2Repo | 54,2 | Repository Aufgaben aus natürlicher Sprache |
| Cybergym | 76,7 | Sicherheitsnahe Coding Aufgaben |
| DSBench FullStack | 68,7 | Full Stack Software Engineering |
DSGVO und DeepSeek: Das größte Problem für europäische Teams
Hier hat sich seit 2025 nichts entspannt. Die Berliner Datenschutzbeauftragte meldete die DeepSeek App bei Apple und Google als rechtswidrigen Inhalt. Der Vorwurf: unrechtmäßige Datenübermittlung nach China ohne ausreichende Schutzgarantien. Sieben Landesdatenschutzbehörden führen seit Februar 2025 abgestimmte Prüfverfahren, Italien hatte den Dienst bereits temporär komplett blockiert.
Die Fakten im Überblick:
- DeepSeek speichert Nutzerdaten auf Servern in China, inklusive Prompts, Chatverläufen und hochgeladenen Dateien
- China hat keinen Angemessenheitsbeschluss der EU Kommission, Transfers dorthin brauchen zusätzliche Garantien
- Es gibt keinen Auftragsverarbeitungsvertrag nach Artikel 28 DSGVO für Unternehmenskunden
- Ein EU Vertreter nach Artikel 27 DSGVO fehlt, genau darum ging es im Prüfverfahren
- Der Landesbeauftragte für den Datenschutz Niedersachsen sieht auch die Anforderungen der KI Verordnung als nicht eingehalten an
Was heißt das konkret? Wer die DeepSeek API oder die Weboberfläche nutzt, überträgt Daten nach China. Privat ist das eine persönliche Risikoabwägung. Im Unternehmen ist es ein Aufsichtsrisiko, und zwar nicht nur nach DSGVO: Auch Geschäftsgeheimnisse haben in einem Kanal ohne Vertragsgrundlage nichts verloren.
Die tragfähige Lösung heißt Self Hosting. Die MIT Lizenz erlaubt es ausdrücklich, die Gewichte liegen offen auf Hugging Face. Auf eigener Infrastruktur verlässt kein Prompt das Netz und der Drittlandtransfer entfällt komplett. Nötig bleiben ein Vertrag mit dem Infrastrukturanbieter, ein Eintrag im Verarbeitungsverzeichnis und bei riskanter Verarbeitung eine Folgenabschätzung. Wie man solche Setups baut, zeigen wir im Vibe Coding Consulting und im Guide welches KI Modell ohne US Anbieter.
DeepSeek gegen Claude Code und OpenCode: Ehrliche Einordnung
Der Vergleich ist 2026 schiefer, als er klingt. DeepSeek ist ein Modell, Claude Code und OpenCode sind Agents. DeepSeek nennt beide sowie OpenClaw explizit als integrierte Umgebungen für V4. Die richtige Frage lautet also nicht entweder oder, sondern welches Modell in welchem Agent.
Stärken von DeepSeek V4. Der Preis pro Token ist konkurrenzlos niedrig. Eine Million Token Kontext als Standard, nicht als Aufpreis. Offene Gewichte unter MIT Lizenz, damit ist Self Hosting rechtlich sauber möglich. Und mit dem 0731 Build hat das kleine Modell bei Agent Aufgaben spürbar aufgeholt.
Schwächen. Die Cloud API ist in Europa nicht sauber nutzbar. Die aktuellen Benchmarkzahlen sind Herstellerangaben ohne unabhängige Prüfung. Der beste Build liegt nur in der API, nicht als Download. Und wer das Modell wirklich selbst betreiben will, braucht ernsthafte Hardware.
Unsere Einordnung: V4-Flash über eine kontrollierte Inferenz für schnelles Prototyping und Agent Läufe, Claude Code für komplexe Refactorings mit tiefem Codebase Verständnis, und in beiden Fällen ein Mensch für Review und Sicherheit. Wer die Kosten gegenrechnen will, findet die Zahlen im Kostenvergleich KI Anbieter China und USA.
DeepSeek selbst betreiben: Ollama, Cloud Tags und echte Kontrolle
Über Ollama sind beide V4 Modelle verfügbar. Achtung beim Suffix: Die Tags mit cloud laufen auf Ollama Infrastruktur, nicht auf deinem Rechner. Der Build vom 31. Juli liegt als eigener Tag daneben und ist inzwischen der Tag, den du nehmen willst.
Ollama hat deepseek-v4-flash:0731-cloud Ende Juli 2026 in die eigene Cloud gestellt und dabei ausdrücklich die stärkeren agentischen Fähigkeiten als Grund genannt. Einen Tag später folgte ein Durchsatz Update, das den Tag laut Ollama gut doppelt so schnell macht wie am Starttag. Dazu eine Million Token Kontext und drei wählbare Denkstufen: schnelle Antwort ohne Reasoning, normales Thinking und Max Thinking für harte Aufgaben.
# Empfohlen: der Build vom 31. Juli 2026
ollama run deepseek-v4-flash:0731-cloud
# Claude Code mit V4-Flash 0731 als Backbone
ollama launch claude --model deepseek-v4-flash:0731-cloud
# Hermes Agent
ollama launch hermes --model deepseek-v4-flash:0731-cloud
# OpenClaw
ollama launch openclaw --model deepseek-v4-flash:0731-cloud
# OpenCode
ollama launch opencode --model deepseek-v4-flash:0731-cloud
# Das grosse Flaggschiff
ollama run deepseek-v4-pro:cloud
Der Punkt an diesen Zeilen: Du tauschst das Modell unter deinem Agenten aus, ohne den Agenten zu wechseln. Das gilt für Claude Code genauso wie für OpenCode, Hermes Agent und OpenClaw. Wer heute mit einem Setup arbeitet und morgen ein anderes Backbone testen will, ändert genau ein Flag. Die Auswahl selbst haben wir in welches KI Modell auswählen ohne US Anbieter durchdekliniert.
Cloud ist nicht lokal. Das ist der Punkt, an dem viele Setups DSGVO technisch auseinanderfallen. Ollama Cloud ist ein US Anbieter, die DeepSeek API ein chinesischer. Wer wirklich will, dass kein Prompt das eigene Netz verlässt, braucht die Gewichte auf eigener Hardware. Für V4-Flash gibt es dafür bereits Community Arbeit: Ein experimenteller llama.cpp Fork zielt mit 2 Bit Quantisierung der Experten auf MacBooks mit 128 GB RAM.
Für Teams, die ohne 128 GB Maschine arbeiten, bleiben die kompakten Alternativen die realistischere Wahl. Welche Modelle lokal wirklich taugen, haben wir in beste Coder Modelle für lokale Nutzung und Ollama Modelle 2026 durchgespielt. Wichtig ist auch das Tool Handling, dazu passt welche KI Modelle für MCP und Tool Handling taugen.
behaves very very well in the chat, frontier-model vibes
DeepSeek kritisch betrachtet: Was 2026 wirklich zählt
Die alte Frage lautete: Wie lange kann DeepSeek diese Preise halten? Die Antwort ist seit Sommer 2026 klar. Das Unternehmen hat seine erste externe Finanzierungsrunde über rund 7,4 Milliarden US Dollar abgeschlossen und wurde dabei mit über 50 Milliarden bewertet. Geld ist kein Engpass mehr.
Interessanter als die Summe ist die Struktur. Die meisten Investoren kauften nicht direkt Anteile, sondern gingen in eine von Gründer Liang Wenfeng kontrollierte Limited Partnership, ohne Stimmrechte und mit fünf Jahren Sperrfrist. Der staatliche National Artificial Intelligence Industry Investment Fund dagegen investierte direkt, mit Stimmrechten und ohne Sperrfrist. Eine zweite Runde bei deutlich höherer Bewertung wurde begonnen und dann vorerst ausgesetzt.
Was daraus für die Bewertung folgt:
- Preisstabilität: kein akutes Thema mehr, dafür ist ein Peak Pricing Modell mit doppeltem Tarif zu Stoßzeiten angekündigt
- Staatsnähe: ein staatlicher Fonds mit Stimmrechten am Tisch ist ein härteres Faktum als jede Zensurdebatte
- Benchmarks: eigene Zahlen auf eigener Harness bleiben eigene Zahlen, bis jemand unabhängig nachmisst
- Offenheit: die MIT Lizenz ist das stärkste Argument, aber der beste Build liegt aktuell nur in der API
Für Entwicklerteams heißt das: DeepSeek V4 ist ein starkes Werkzeug im Kasten, kein Fundament. Wer damit produktive Software ausliefert, braucht Tests, Reviews und eine Infrastruktur, die er selbst kontrolliert. Genau daran arbeiten wir im Vibe Coding Consulting und in unseren Vibe Coding Best Practices.
Unsere Erfahrung mit offenen Modellen im Entwickleralltag
Bei Never Code Alone laufen KI Modelle nicht in der Präsentation, sondern im Terminal. Wir arbeiten täglich mit lokaler Inferenz über Ollama, mit OpenCode und Claude Code, und wir kennen den Unterschied zwischen einem beeindruckenden Benchmark und einem Modell, das im echten Projekt hält.
Der Punkt, an dem Teams scheitern, ist selten die Modellwahl. Es ist die Kette dahinter: Tests, die den generierten Code prüfen. Reviews, die jemand ernst nimmt. Eine CI Pipeline, die Fehler findet, bevor sie live gehen. Ohne das ist jedes Modell nur eine schnellere Art, Schulden aufzubauen.
Wo wir konkret helfen: bei der Einrichtung DSGVO konformer KI Infrastruktur, bei der Auswahl passender Vibe Coding Tools, im Vibe Coding Training für Teams, bei PHP Refactoring mit KI Unterstützung und im Frontend Development. Ein Überblick über unsere Werkzeuge steht unter NCA KI Tools.
NCA Vibe Coding Consulting
Roland Golla ist Entwickler aus Leidenschaft – seit über 20 Jahren. Er hat hunderte Projekte begleitet, von Legacy-Refactoring bis KI-Integration. Bei Vibe Coding verbindet er das Beste aus beiden Welten: Die Geschwindigkeit von KI-generiertem Code mit der Qualität professioneller Softwareentwicklung. Kein Bullshit, keine Agentur-Floskeln – direkte Hilfe von jemandem, der selbst täglich im Code steckt.
Häufige Fragen zu DeepSeek
Die wichtigsten Fragen zu DeepSeek V4, den offiziellen Preisen, der Migration von den alten API Namen und dem DSGVO konformen Einsatz.
Was ist DeepSeek V4 und seit wann gibt es das Modell 2026?
DeepSeek V4 ist die aktuelle Modellgeneration von DeepSeek AI, veröffentlicht als Preview am 24. April 2026. Sie besteht aus V4-Pro mit 1,6 Billionen Parametern und V4-Flash mit 284 Milliarden, jeweils als Mixture of Experts mit einer Million Token Kontext. Die Gewichte liegen offen auf Hugging Face unter MIT Lizenz.
Was hat sich mit dem V4-Flash Build 0731 im Juli 2026 geändert?
Architektur und Größe sind identisch geblieben, DeepSeek hat das Modell ausschließlich neu post trainiert. Die veröffentlichten Agent Benchmarks steigen dadurch deutlich, Terminal Bench 2.1 etwa von 61,8 auf 82,7. Alle Werte stammen von DeepSeek selbst und sind bislang nicht unabhängig bestätigt. Neu sind außerdem Responses API Support und Codex Anpassung.
Was kostet die DeepSeek API 2026 pro Million Token?
Laut offizieller DeepSeek Dokumentation kostet V4-Flash 0,14 US Dollar für eine Million Input Token bei Cache Miss, 0,0028 bei Cache Hit und 0,28 für Output. V4-Pro liegt bei 0,435, 0,003625 und 0,87. Angekündigt ist zusätzlich ein Modell mit doppeltem Tarif zu Stoßzeiten, ein Starttermin steht noch aus.
Sind deepseek-chat und deepseek-reasoner 2026 noch nutzbar?
Nein. Beide API Namen wurden am 24. Juli 2026 endgültig abgeschaltet. Wer sie noch aufruft, bekommt keine Antwort mehr. Die gültigen Modellnamen sind deepseek-v4-flash und deepseek-v4-pro. Die base_url bleibt unverändert, es genügt also, den Modellparameter zu tauschen.
Ist DeepSeek 2026 DSGVO konform nutzbar?
Über die Cloud API und die Weboberfläche nicht. Daten gehen auf Server in China, es fehlen Auftragsverarbeitungsvertrag und EU Vertreter, mehrere deutsche Aufsichtsbehörden prüfen den Anbieter. Tragfähig ist ausschließlich Self Hosting der offenen Gewichte auf eigener oder europäischer Infrastruktur.
Was ist der Unterschied zwischen V4-Pro und V4-Flash?
V4-Pro ist das Flaggschiff mit 1,6 Billionen Gesamtparametern und 49 Milliarden aktiv pro Token. V4-Flash hat 284 Milliarden gesamt und 13 Milliarden aktiv, ist damit schneller und deutlich günstiger. Seit dem Juli Build liegt Flash bei Agent Aufgaben laut Hersteller sogar vor dem Pro Preview.
Was bedeutet ein Kontextfenster von einer Million Token in der Praxis?
Das Modell kann sehr große Codebasen am Stück lesen, statt sie in Häppchen zu bekommen. Cross File Reasoning über ganze Repositories wird damit realistisch. DeepSeek erreicht das über Token Kompression und Sparse Attention, was Rechenlast und Speicherbedarf bei langem Kontext stark senkt.
Kann ich DeepSeek V4 lokal auf meinem Rechner betreiben?
V4-Flash ja, mit Einschränkungen. Ein experimenteller llama.cpp Fork zielt mit 2 Bit Quantisierung der Experten auf Maschinen mit 128 GB RAM. V4-Pro braucht Serverhardware. Für normale Entwicklerrechner sind kompakte Modelle wie Qwen3 Coder die realistischere Wahl.
Was ist der Unterschied zwischen Ollama Cloud und lokalem Hosting?
Tags mit dem Suffix cloud laufen auf Ollama Infrastruktur, nicht auf dem eigenen Rechner. Der Prompt verlässt also das Netzwerk. Für DSGVO relevante Verarbeitung zählt nur echtes lokales Hosting oder eine Inferenz auf Infrastruktur, für die ein Vertrag existiert.
Sind DeepSeek R1 und Coder V2 noch eine Option?
Für neue Projekte nicht. R1 war Anfang 2025 der Durchbruch, Coder V2 lange das dedizierte Code Modell. Beide wurden von V3.2 und dann V4 abgelöst. Wer heute startet, sollte direkt mit V4 arbeiten oder ein aktuelles offenes Konkurrenzmodell prüfen.
Wie verlässlich sind die Benchmark Angaben von DeepSeek?
Sie sind Herstellerangaben. Gemessen hat DeepSeek auf einer eigenen Harness, die noch nicht veröffentlicht ist, zwei der neun Benchmarks sind interne Testsets. Bis unabhängige Labore nachmessen, gehören diese Zahlen in die Kategorie plausibel, aber unbestätigt.
Welche Rolle spielt der chinesische Staat bei DeepSeek?
In der ersten Finanzierungsrunde investierte der staatliche National Artificial Intelligence Industry Investment Fund direkt, mit Stimmrechten und ohne Sperrfrist, während private Investoren über eine Partnership ohne Stimmrechte einstiegen. Für Unternehmen mit sensiblen Daten ist das ein relevanter Punkt in der Risikobewertung.