FlexGen — njĂ« motor pĂ«r ekzekutimin e AI-botĂ«ve tĂ« ngjashĂ«m me ChatGPT nĂ« sisteme me njĂ« GPU.

Një grup hulumtuesish nga Universiteti i Stanford, Universiteti i Kalifornisë në Berkeley, Shkolla Politeknike Federale të Zyrihut, Shkolla e Lartë e Ekonomisë, Universiteti Carnegie Mellon, si dhe kompanitë Yandex dhe Meta, publikuan kodin burimor të motorit për ekzekutimin e modeleve të mëdha gjuhësore në sisteme me burime të kufizuara. Për shembull, motori ofron mundësinë për të krijuar funksionalitete të ngjashme me ChatGPT dhe Copilot, duke ekzekutuar një model të trajnuar tashmë OPT-175B, që mbulon 175 miliardë parametra, në një kompjuter të zakonshëm me një kartë grafike NVIDIA RTX3090, e pajisur me 24GB memorie grafike. Kodi është shkruar në gjuhën Python, përdor kornizën PyTorch dhe shpërndahet nën licencën Apache 2.0.

NĂ« paketĂ« pĂ«rfshihet njĂ« shembull i skenarit pĂ«r krijimin e robotĂ«ve, i cili lejon ngarkimin e njĂ« nga modelet gjuhĂ«sore publike dhe menjĂ«herĂ« fillimin e njĂ« bisedimi (pĂ«r shembull, duke ekzekutuar komandĂ«n «python apps/chatbot.py —model facebook/opt-30b — -percent 0 100 100 0 100 0»). Si bazĂ« rekomandohet pĂ«rdorimi i modelit tĂ« madh gjuhĂ«sor tĂ« publikuar nga Facebook, i trajnuar mbi koleksionet BookCorpus (10 mijĂ« libra), CC-Stories, Pile (OpenSubtitles, Wikipedia, DM Mathematics, HackerNews etj.), Pushshift.io (bazuar nĂ« tĂ« dhĂ«nat e Reddit) dhe CCNewsV2 (arkiv lajmesh). Modeli mbulon rreth 180 miliardĂ« toka (800 GB tĂ« dhĂ«nash). Trajnimi i modelit zgjati 33 ditĂ« me punĂ«n e njĂ« klasteri me 992 GPU NVIDIA A100 80GB.

Në ekzekutimin e modelit OPT-175B në një sistem me një GPU NVIDIA T4 (16GB), motori FlexGen demonstroi performancë deri në 100 herë më të lartë se zgjidhjet e propozuara më parë, duke e bërë përdorimin e modeleve të mëdha gjuhësore më të aksesueshme dhe duke lejuar ekzekutimin e tyre në sisteme pa akceleratorë të specializuar. Po ashtu, FlexGen mund të shkallëzohet për të parallelizuar llogaritjet në prani të disa GPU-ve. Për të zvogëluar madhësinë e modelit, aplikohet gjithashtu një skemë e veçantë e kompresimit të parametrave dhe një mekanizëm të ruajtjes së modeleve.

Aktualisht, FlexGen mbështet vetëm modelet gjuhësore OPT, por në të ardhmen zhvilluesit gjithashtu premtojnë të shtojnë mbështetje për modelet BLOOM (176 miliardë parametra, mbështet 46 gjuhë dhe 13 gjuhë programuese), CodeGen (mund të gjenerojë kod në 22 gjuhë programuese) dhe GLM. Një shembull dialogu me një robot të bazuar në FlexGen dhe modelin OPT-30B:

Njeri: Çdo quhet mali mĂ« i lartĂ« nĂ« botĂ«?

Asistent: Everest.

Njeri: Po planifikoj njĂ« udhĂ«tim pĂ«r pĂ«rvjetorin tonĂ«. ÇfarĂ« gjĂ«rash mund tĂ« bĂ«jmĂ«?

Asistent: Epo, ka disa gjëra që mund të bëni për përvjetorin tuaj. Së pari, mund të luani letra. Së dyti, mund të shkoni për një ecje. Së treti, mund të shkoni në një muze.

Burimi: opennet.ru

Bleni hostim tĂ« besueshĂ«m pĂ«r faqe me mbrojtje nga DDoS, serverĂ« VPS VDS đŸ”„ Bleni hostim tĂ« besueshĂ«m pĂ«r faqe me mbrojtje nga DDoS, serverĂ« VPS VDS | ProHoster