ESP32-S3:lla lanseerattiin 28,9 miljoonaa parametria sisältävä kielimalli.


Kehittäjä Vjatšeslav Serbov, joka käyttää salanimeä slvDev, osoittanut Täysin paikallista tekstin generointia ESP32-S3-mikrokontrollerilla. Tuloksena oleva kielimalli sisältää 28,9 miljoonaa parametria ja tuottaa noin 9,9 tokenia sekunnissa ilman palvelimen tai muiden ulkoisten laskentaresurssien käyttöä. Luodut novellit näytetään kytketyllä OLED-näytöllä.

 

Hanke esp32-ai Testattu ESP32-S3 N16R8 -moduulilla, jossa on 512 kt sisäänrakennettua SRAM-muistia, 8 Mt PSRAM-muistia ja 16 Mt flash-muistia. 4-bittinen kvantisoitu malli vie 14,9 Mt. Säilytyspaikka sisältää C-kielisen ajonaikaisen lähdekoodin, koulutus- ja kvantisointityökalut, laiteohjelmiston, testit ja skriptit sen lataamiseksi piirilevylle.

 

Väitettyjä 28,9 miljoonaa parametria ei pitäisi verrata suoraan perinteisten työpöytäversioiden LLM-ohjelmien parametrien määrään. yksityiskohtainen kehittäjäraporttiMalli koostuu tiheästä laskennallisesta ytimestä, jossa on noin 559 000 parametria, tulostuokiosta, jossa on 3,1 miljoonaa parametria, ja kerrostettujen vektoriesitysten taulukosta, jossa on noin 25 miljoonaa parametria. Jälkimmäinen muodostaa suurimman osan mallin muodollisesta koosta, mutta sitä ei käsitellä kokonaan jokaisen tunnuksen luomisen yhteydessä.

 

Mallin tallentamiseen käytetään kolmea muistitasoa. Useimmin käytetyt tiedot sijaitsevat sisäisessä SRAM-muistissa, tulostuskerros, KV-välimuisti ja väliaikaiset puskurit sijaitsevat PSRAM-muistissa, ja 25 miljoonan alkion taulukko sijaitsee flash-muistissa ja siihen pääsee käsiksi osoiteavaruuskartoituksen kautta. Jokaisesta tokenista luetaan vain noin kuusi riviä, yhteensä noin 450 tavua.

 

Tämä laite perustuu Googlen Gemma 3n:ssä käyttämään Per-Layer Embeddings -teknologiaan. Googlen dokumentaatioPLE-parametreja voidaan tallentaa mallin työmuistin ulkopuolelle ja lisätä päättelyprosessiin yksittäisten kerrosten käsittelyn yhteydessä. esp32-ai:ssa tätä lähestymistapaa laajennetaan mikrokontrollerin muistihierarkiaan, jossa nopea SRAM on erityisen rajallinen.

 

C-pohjaisen suoritusympäristön ensimmäinen oikea versio tuotti vain 0,57 tokenia sekunnissa. Kun lähtökerros sijoitettiin PSRAM-muistiin, vaihdettiin kahdeksanbittisiin aktivointiin, laskenta jaettiin kahden Xtensa LX7 -ytimen kesken ja tehtiin muita optimointeja, latenssi pieneni 94,9 millisekuntiin malliaskelta kohden. Lopullinen mitattu läpäisykyky oli 9,88 tokenia sekunnissa, ottaen huomioon koko generointiprosessin. Suurimmaksi rajoitukseksi tuli nyt PSRAM-kaistanleveys lähtökerrosta luettaessa.

 

Malli koulutettiin synteettisellä tietojoukolla TinyStories, joka koostuu yksinkertaisista englanninkielisistä tarinoista, joilla on rajallinen sanavarasto. Siksi se voi jatkaa lauseita ja laatia lyhyitä, yhtenäisiä tarinoita, mutta sitä ei ole suunniteltu vastaamaan kysymyksiin, noudattamaan ohjeita, ohjelmoimaan tai toistamaan faktatietoa. Kehittäjä näkee työn ensisijaisesti osoituksena mallin tehokkaasta sijoittelusta mikrokontrollerin muistiin, eikä valmiina, autonomisena chatbottina.

 

Nykyisessä dokumentaatiossa kirjoittaja korostaa erityisesti, että esp32-ai on itsenäinen kehitysprojekti. llama2.c Andrej Karpathyn työ ja ESP32-S3:n 260 000. mallin aiempi lanseeraus tarjotaan vain ohjeina ja esimerkkeinä aiemmasta työstä: koodia, tarkistuspisteitä ja metodologiaa ei ole lainattu suoraan heiltä. esp32-ai:n lähdekoodi jaettu MIT-lisenssillä.

 

Lähde: linux.org.ru

Osta luotettava isännöinti sivustoille, joissa on DDoS-suojaus, VPS VDS -palvelimet 🔥 Osta luotettavaa verkkosivustojen hostingia DDoS-suojauksella, VPS VDS -palvelimilla | ProHoster