Siirry pääsisältöön
Teknologia

DeepSeek julkaisi uudet avoimet V4-kielimallit

Kuvituskuva uutiseen: DeepSeek julkaisi uudet avoimet V4-kielimallit (deepseek, tekoäly)
Photo by Solen Feyissa on Unsplash
Pohjautuu lähteeseen mobiili.fi

Kiinalainen DeepSeek on julkaissut uuden sukupolven kielimallit V4-sarjassa. Yhtiön mukaan uudistukset kohdistuvat erityisesti pitkän kontekstin käsittelyyn, päättelyyn ja agenttipohjaisiin työnkulkuihin. Malliperheeseen kuuluu kaksi pääversiota, tehokkaampi DeepSeek-V4-Pro sekä kevyempi DeepSeek-V4-Flash, ja niiden käyttökohteiksi kuvataan etenkin tutkimus, ohjelmistokehitys sekä muut monivaiheiset tehtävät.

Suurin yksittäinen muutos liittyy tuettuun kontekstipituuteen. Paketin mukaan DeepSeek-V4 tukee jopa miljoonan tokenin pyyntöjä. Tämä tarkoittaa, että mallien on tarkoitus kyetä käsittelemään erittäin pitkiä dokumentteja, laajoja koodikantoja ja monivaiheisia analyysejä yhdellä kertaa. Pitkän kontekstin tuki on ollut yksi keskeisistä kilpailutekijöistä suurissa kielimalleissa, joten DeepSeek nostaa sen julkaisun kärkiominaisuudeksi.

Kaksi malliversiota eri käyttötarkoituksiin

Paketin mukaan DeepSeek-V4-Pro on mallisarjan raskaampi versio. Sen kerrotaan sisältävän 1,6 biljoonaa parametria, joista aktiivisessa käytössä on 49 miljardia. Malli on suunnattu vaativaan päättelyyn ja ohjelmointiin.

Kevyempi DeepSeek-V4-Flash puolestaan painottaa nopeutta ja alempia kustannuksia. Sen ilmoitetaan sisältävän 284 miljardia parametria, joista aktiivisia on 13 miljardia. Näin yhtiö asemoi Pro- ja Flash-versiot eri tarpeisiin: toinen tähtää suorituskykyyn, toinen tehokkaampaan käyttöön kevyemmässä muodossa.

DeepSeek kertoo hyödyntävänsä Mixture-of-Experts-rakennetta, jossa vain osa mallin parametreista on käytössä kerrallaan. Tavoitteena on parantaa suorituskykyä ilman vastaavaa laskentakuorman kasvua.

Pitkät kontekstit ja agenttityökalut keskiössä

Teknisissä ratkaisuissa korostuvat myös uudet optimointikeinot. Paketin mukaan mallit käyttävät tiivistettyä ja harvaa attention-mekanismia, usean tokenin ennustamista sekä matalamman tarkkuuden laskentaa, kuten FP4- ja FP8-muotoja. Näiden tarkoituksena on pitää muistinkäyttö ja laskentateho hallinnassa, vaikka mallien koko on kasvanut.

DeepSeek-V4 on lisäksi rakennettu tukemaan agenttipohjaisia työnkulkuja. Tällä viitataan käyttöön, jossa tekoäly hyödyntää työkaluja, suorittaa monivaiheisia tehtäviä ja etenee päätöksenteossa usean vaiheen kautta. Paketissa mainitaan, että malleja voidaan integroida esimerkiksi kehitystyökaluihin ja automatisoituihin prosesseihin.

Yhtiö kertoo myös mallien tulosten parantuneen erityisesti päättelytehtävissä, ohjelmoinnissa ja pitkän kontekstin käsittelyssä. Paketin loppuosa viittaa kilpailijavertailuihin, mutta niiden yksityiskohdat jäävät aineistossa kesken. Varmistettua kuitenkin on, että DeepSeek asemoi V4-sarjan avoimina malleina vaativaan käyttöön, jossa painottuvat laaja konteksti, tehokkaampi päättely ja agenttimainen toiminta.

Jatka aiheesta Teknologia.

Toimitus Uutistenlukija-toimitus

Uutistenlukija on suomalainen verkkolehti, joka kirjoittaa alkuperäisiä uutisartikkeleita.

Artikkeli on laadittu tekoälyavusteisesti. Lue toimitusperiaatteemme.

Jatka aiheesta Lisää teknologia-aiheisia artikkeleita