
DeepSeek V4-Flash — Suorituskykytestit, Ominaisuudet ja Käyttötapaukset
DeepSeek V4-Flash on DeepSeekin avoimen painotuksensa omaava tekoälymalli (13B/284B MoE), luokiteltuna Advanced-tasolle, jonka konteksti-ikkuna on 1 miljoona to...
DeepSeek V4-Pro on huipputason Frontier-tekoälymalli, jonka on kehittänyt DeepSeek ja joka julkaistiin huhtikuussa 2026. Avoimen painoarvon mallina sen koulutetut painoarvot ovat julkisesti saatavilla — voit isännöidä sen itse, hienosäätää sitä omalla datallasi tai ajaa sitä omassa ympäristössäsi ilman API-riippuvuuksia. 1 miljoonan tokenin konteksti-ikkuna on riittävän suuri käsittelemään kokonaisia koodikantoja, pitkiä teknisiä dokumentteja tai laajoja agenttisessioita ilman katkaisua.
FlowHunt AI Leaderboardissa se on yksi 24 seuratusta mallista, arvioituna 9 vertailuarvossa. Huomionarvoiset pisteet: 93,5 % LiveCodeBenchissa (#1/5); 87,5 % MMLU-Prossa (#2/8); 46,0 % ARC-AGI-2:ssa (#3/3).
DeepSeek V4-Pro julkaistiin 24. huhtikuuta 2026 DeepSeekin neljännen sukupolven V-sarjan lippulaivamallina. Se saavutti 93,5 % LiveCodeBenchissa julkaisuhetkellä — korkein kilpailevan ohjelmoinnin pistemäärä kaikista mitatuista malleista — ja sai korkeimman itse ilmoitetun SWE-bench Verified -pistemäärän Claude Fable 5:n jälkeen, 80,6 %. Julkaisu herätti merkittävää keskustelua, kun CAISI mittasi V4-Pro:n SWE-bench-pistemääräksi 74,0 % eikä 80,6 %, jonka DeepSeek oli ilmoittanut — 6,6 pisteen ero, jonka DeepSeek selitti scaffoldointi- ja token-budjettieroista arviointiasetelmissa. Avoimen painoarvon mallina, jossa on 1M konteksti-ikkuna ja 49B/1,6T MoE-arkkitehtuuri, V4-Pro:sta tuli johtava itse isännöitävä vaihtoehto tiimeille, jotka priorisoivat koodauskyvykkyyttä täydellä datan hallinnalla.
Huomautus: SWE-bench-ero: SR 80,6 % vs. CAISI 74,0 %. LiveCodeBench 93,5 % korkein raportoitu.
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% | 6 of 13 | SR | Real GitHub issue resolution (500 verified issues) |
| SWE-bench Pro | 55.4% | 9 of 9 | SR | Multi-language, standardised scaffold |
| GPQA Diamond | 90.1% | 6 of 14 | SR | Graduate-level Google-proof science Q&A |
| MMLU-Pro | 87.5% | 2 of 8 | SR | Hard knowledge reasoning, 12K questions |
| LiveCodeBench | 93.5% | 1 of 5 | SR | Competitive programming, continuously updated |
| Terminal-Bench | 67.9% | 4 of 8 | SR | Agentic Linux terminal task completion |
| ARC-AGI-2 | 46.0% | 3 of 3 | C | Novel visual reasoning, no memorisation |
| HLE | 37.7% | 4 of 6 | SR | Humanity's Last Exam (50+ STEM disciplines) |
| AA Intelligence Index | 52.0 pts | 6 of 9 | AA | Artificial Analysis composite score (independent) |
Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.
| Benchmark | DeepSeek V4-Pro | Claude Opus 4.8 | Claude Opus 4.7 |
|---|---|---|---|
| SWE-V | 80.6% | 88.6% | 87.6% |
| SWE-Pro | 55.4% | 69.2% | 64.3% |
| GPQA ◇ | 90.1% | 93.6% | 94.2% |
| MMLU-P | 87.5% | — | — |
| LiveCode | 93.5% | — | — |
| Terminal | 67.9% | 74.6% | 66.1% |
| ARC-2 | 46.0% | — | — |
| HLE | 37.7% | — | — |
| AA Idx | 52.0 pts | 61.4 pts | 57.3 pts |
DeepSeek on kiinalainen tekoälytutkimuslaboratorio, joka perustettiin vuonna 2023 High-Flyerin, yhden Kiinan suurimmista kvantitatiivisista hedge-rahastoista, tytäryhtiönä. Laboratorio tuli laajalti tunnetuksi alkuvuodesta 2025, kun DeepSeek V3:n ja R1:n julkaisu aiheutti NVIDIA-markkina-arvon suurimman yksittäisen päivän laskun siihen asti, kun sijoittajat arvioivat uudelleen huippumallien kehityksen pääomaintensiteettiä DeepSeekin raportoitujen alhaisempien koulutuskustannusten valossa. DeepSeek on epätavallinen huippulaboratorioiden joukossa sitoutumisessaan avoimen painon malleihin oman tutkimuksensa rinnalla sekä aktiivisen sosiaalisen median läsnäolon ylläpitämisessä, jossa se kritisoi suljettujen mallien hinnoittelua. Sen V-sarjan malleja (V3–V4-Pro) käytetään laajalti itse isännöitävinä koodaus- ja päättelymalleina länsimaissa huolimatta kiinalaisalkuperää oleviin tekoälymalleihin kohdistuvasta jatkuvasta sääntely- ja turvallisuustarkastelusta useilla lainkäyttöalueilla.
Käyttötapaukset
DeepSeek V4-Pro saavuttaa 80 % SWE-bench Verified -testissä — sijalla #6/13 tässä seuratusta mallista. Se ratkoo oikeita GitHub-ongelmia, tuottaa tuotantolaatuista koodia useilla kielillä ja käsittelee monivaiheisia agenttisia koodaustyönkulkuja — vahva valinta tekoälyavusteisille ohjelmistokehitystiimeille.
90 %:lla GPQA Diamondissa (#6/14 mallista) DeepSeek V4-Pro ylittää noin 65 %:n inhimillisen tohtoritason asiantuntijoiden perustason biologisten, kemiallisten ja fysikaalisten kysymysten osalta. Käytä sitä tieteellisen kirjallisuuden synteesiin, hypoteesien arviointiin, lääketieteellisiin ja oikeudellisiin kysymys-vastaus-tehtäviin sekä monitieteisiin tutkimustehtäviin, joissa syvä asiantuntemus on tärkeää.
DeepSeek V4-Pro saavuttaa 67 % Terminal-Benchissä (#4/8 mallista), mikä tekee siitä pätevän yleisissä komentoriviskriptauksissa, komentorivityönkuluissa ja kevyissä järjestelmänhallintatehtävissä agenttiputkien sisällä.
DeepSeek V4-Pro on avoimen painoarvon malli (49B/1,6T MoE -parametrit) — sen koulutetut painoarvot ovat julkisesti ladattavissa ja itse käytettävissä. Aja sitä omalla GPU-laitteistollasi tai yksityisessä pilvessä varmistaaksesi, ettei data koskaan poistu ympäristöstäsi, poista token-kohtaiset API-kustannukset suuressa mittakaavassa tai hienosäädä mallia omilla tietojoukoillasi.
1 miljoonan tokenin konteksti-ikkunalla DeepSeek V4-Pro pystyy käsittelemään kokonaisia ohjelmistovarastoja, pitkiä juridisia sopimuksia, kirjanmittaisia tutkimusraportteja tai laajoja keskusteluhistorioita yhdellä kehotteella — mahdollistaen syvällisen dokumenttien kysely-vastaus-toiminnon, tiedostojen välisen koodikantapäättelyn ja kattavan tiivistämisen ilman paloitteluheuristiikkoja tai RAG-putkia.
DeepSeek V4-Pro saavuttaa 93 % LiveCodeBenchissä (#1/5 mallista), kontaminaatiora kestävässä vertailuarvossa, jota päivitetään jatkuvasti uusilla kilpailevan ohjelmoinnin ongelmilla. Tällä tasolla se käsittelee edistyneitä tietorakenteita, graafialgoritmeja ja haastattelutason tehtäviä korkealla luotettavuudella.
Lisää Vertailtavaa
Vertaa kaikkia 24 mallia 11 vertailuarvossa — lajiteltava, lähdeviitteellinen ja päivitetty kesäkuussa 2026.

DeepSeek V4-Flash on DeepSeekin avoimen painotuksensa omaava tekoälymalli (13B/284B MoE), luokiteltuna Advanced-tasolle, jonka konteksti-ikkuna on 1 miljoona to...

Integroi FlowHunt DeepSeek MCP Serveriin ja tuo edistyneet kielimallit osaksi tekoälytyöprosessejasi. Proxioi DeepSeek API -kutsut turvallisesti, mahdollista an...

Llama 4 Scout on Metan avoimen painoarvon tekoälymalli (17B/109B MoE (16 asiantuntijaa)), joka on luokiteltu Vakiintunut-tasolle ja jolla on 10 miljoonan tokeni...