ESP32-S3 တွင် parameters ၂၈.၉ သန်းပါသော language model တစ်ခုကို စတင်ခဲ့သည်။


တီထွင်သူ Vyacheslav Serbov၊ ကလောင်အမည် slvDev၊ သရုပ်ပြခဲ့သည် ESP32-S3 မိုက်ခရိုကွန်ထရိုလာပေါ်တွင် လုံးဝဒေသတွင်းစာသားထုတ်လုပ်ခြင်း။ ရရှိလာသော ဘာသာစကားမော်ဒယ်တွင် ကန့်သတ်ချက် ၂၈.၉ သန်းပါဝင်ပြီး ဆာဗာ သို့မဟုတ် အခြားပြင်ပကွန်ပျူတာအရင်းအမြစ်များကို ဝင်ရောက်ကြည့်ရှုခြင်းမရှိဘဲ တစ်စက္ကန့်လျှင် တိုကင် ၉.၉ ခန့် ထုတ်လုပ်ပေးသည်။ ထုတ်လုပ်ထားသော ဝတ္ထုတိုများကို ချိတ်ဆက်ထားသော OLED မျက်နှာပြင်တွင် ပြသထားသည်။

 

စီမံကိန်း၏ esp32-ai ESP32-S3 N16R8 မော်ဂျူးတွင် onboard SRAM 512 KB၊ PSRAM 8 MB နှင့် flash memory 16 MB ပါရှိသည်။ 4-bit quantized မော်ဒယ်သည် 14,9 MB နေရာယူထားသည်။ repository တွင် C runtime source code၊ training နှင့် quantization tools များ၊ firmware၊ စမ်းသပ်မှုများနှင့် board သို့ upload လုပ်ရန်အတွက် scripts များပါရှိသည်။

 

တောင်းဆိုထားသော ၂၈.၉ သန်းသော ကန့်သတ်ချက်များကို ရိုးရာ desktop LLM များ၏ ကန့်သတ်ချက်အရေအတွက်နှင့် တိုက်ရိုက်နှိုင်းယှဉ်ခြင်းမပြုသင့်ပါ။ အဆိုအရ အသေးစိတ် developer အစီရင်ခံစာမော်ဒယ်တွင် ခန့်မှန်းခြေအားဖြင့် parameter ၅၅၉,၀၀၀ ပါရှိသော dense computational kernel တစ်ခု၊ parameter ၃.၁ သန်းပါရှိသော output layer တစ်ခုနှင့် parameter ၂၅ သန်းခန့်ပါရှိသော layered vector ကိုယ်စားပြုမှုဇယားတစ်ခုတို့ ပါဝင်သည်။ နောက်ပိုင်းတွင် မော်ဒယ်၏ တရားဝင်အရွယ်အစား၏ အများစုကို ပံ့ပိုးပေးသော်လည်း တိုကင်တစ်ခုစီကို ထုတ်လုပ်သည့်အခါတွင် အပြည့်အဝ မလုပ်ဆောင်ပါ။

 

မော်ဒယ်ကိုသိမ်းဆည်းရန်အတွက် မှတ်ဉာဏ်အဆင့်သုံးဆင့်ကို အသုံးပြုထားသည်။ အများဆုံးဝင်ရောက်ကြည့်ရှုသောဒေတာသည် internal SRAM တွင်တည်ရှိပြီး output layer၊ KV cache နှင့် temporary buffers များသည် PSRAM တွင်တည်ရှိပြီး 25-million-item table သည် flash memory တွင်တည်ရှိပြီး address space mapping မှတစ်ဆင့်ဝင်ရောက်ကြည့်ရှုနိုင်သည်။ token တစ်ခုစီအတွက် row ခြောက်ခုခန့်သာ ၎င်းမှဖတ်ပြီး စုစုပေါင်း 450 bytes ခန့်ရှိသည်။

 

ဒီကိရိယာဟာ Google က Gemma 3n မှာ အသုံးပြုတဲ့ Per-Layer Embeddings နည်းပညာကို အခြေခံထားပါတယ်။ Google စာရွက်စာတမ်းများPLE parameters များကို မော်ဒယ်၏ အလုပ်လုပ်သော မှတ်ဉာဏ်အပြင်ဘက်တွင် သိမ်းဆည်းနိုင်ပြီး တစ်ဦးချင်း အလွှာများကို လုပ်ဆောင်သည်နှင့်အမျှ inference လုပ်ငန်းစဉ်သို့ ထည့်သွင်းနိုင်သည်။ esp32-ai တွင် ဤချဉ်းကပ်မှုကို မိုက်ခရိုကွန်ထရိုလာ၏ မှတ်ဉာဏ်အဆင့်ဆင့်အထိ တိုးချဲ့ထားပြီး၊ မြန်နှုန်းမြင့် SRAM သည် အထူးကန့်သတ်ထားသည်။

 

C-based runtime ရဲ့ ပထမဆုံး မှန်ကန်တဲ့ version က တစ်စက္ကန့်ကို 0,57 tokens ပဲ ထုတ်လုပ်ပေးခဲ့ပါတယ်။ output layer ကို PSRAM မှာ ထားပြီးနောက်၊ eight-bit activation ကို ပြောင်းပြီး Xtensa LX7 cores နှစ်ခုကြားမှာ computation ကို ဖြန့်ဝေပေးတာနဲ့ တခြား optimization တွေ လုပ်ပြီးနောက်၊ model step တစ်ခုမှာ latency က 94,9 ms အထိ လျော့ကျသွားခဲ့ပါတယ်။ full generation process ကို ထည့်သွင်းစဉ်းစားရင် နောက်ဆုံးတိုင်းတာထားတဲ့ throughput က တစ်စက္ကန့်ကို 9,88 tokens အထိ ရောက်ရှိခဲ့ပါတယ်။ အဓိက ကန့်သတ်ချက်ကတော့ output layer ကို ဖတ်တဲ့အခါ PSRAM bandwidth ဖြစ်လာပါတယ်။

 

မော်ဒယ်ကို ပေါင်းစပ်ဒေတာစုတွင် လေ့ကျင့်ပေးခဲ့သည်။ Tiny Storiesဝေါဟာရအကန့်အသတ်ရှိသော ရိုးရှင်းသော အင်္ဂလိပ်ဘာသာ ဇာတ်လမ်းများ ပါဝင်သည်။ ထို့ကြောင့် ၎င်းသည် စာကြောင်းများကို ဆက်လက်ရေးသားနိုင်ပြီး တိုတောင်းပြီး ညီညွတ်သော ဇာတ်လမ်းများကို ရေးသားနိုင်သော်လည်း မေးခွန်းများကို ဖြေဆိုရန်၊ ညွှန်ကြားချက်များကို လိုက်နာရန်၊ ပရိုဂရမ်ရေးသားရန် သို့မဟုတ် အချက်အလက်ဆိုင်ရာ အသိပညာများကို ပြန်လည်ထုတ်လုပ်ရန် ဒီဇိုင်းထုတ်ထားခြင်း မဟုတ်ပါ။ ဆော့ဖ်ဝဲရေးသားသူသည် အလုပ်ကို အသင့်ပြင်ဆင်ထားသော၊ ကိုယ်ပိုင်အုပ်ချုပ်ခွင့်ရှိသော chatbot အဖြစ်ထက် မိုက်ခရိုကွန်ထရိုလာ မှတ်ဉာဏ်တွင် မော်ဒယ်၏ ထိရောက်သော နေရာချထားမှုကို သရုပ်ပြခြင်းအဖြစ် အဓိကထား ရှုမြင်သည်။

 

လက်ရှိစာရွက်စာတမ်းတွင် စာရေးသူက esp32-ai သည် လွတ်လပ်သော ဖွံ့ဖြိုးတိုးတက်မှုတစ်ခုဖြစ်ကြောင်း အထူးအလေးပေးဖော်ပြထားသည်။ ပရောဂျက်များ လာမာ ၂.စီ Andrej Karpathy ရဲ့ လုပ်ဆောင်ချက်နဲ့ ESP32-S3 မှာ ၂၆၀,၀၀၀ မြောက် မော်ဒယ်ကို အစောပိုင်းမှာ မိတ်ဆက်ခဲ့တာဟာ ယခင်လုပ်ဆောင်ချက်တွေရဲ့ လမ်းညွှန်ချက်တွေနဲ့ ဥပမာတွေအဖြစ်သာ ပေးထားတာပါ- ကုဒ်၊ စစ်ဆေးရေးဂိတ်တွေနဲ့ နည်းလမ်းတွေကို သူတို့ဆီကနေ တိုက်ရိုက်ယူသုံးထားတာ မဟုတ်ပါဘူး။ esp32-ai source code MIT လိုင်စင်အောက်တွင် ဖြန့်ဝေထားသည်.

 

source: linux.org.ru

DDoS ကာကွယ်ရေး၊ VPS VDS ဆာဗာများပါသည့် ဆိုက်များအတွက် ယုံကြည်စိတ်ချရသော hosting ကို ဝယ်ယူပါ။ 🔥 DDoS ကာကွယ်မှု၊ VPS VDS ဆာဗာများပါရှိသော ယုံကြည်စိတ်ချရသော ဝဘ်ဆိုက် hosting ကို ဝယ်ယူပါ | ProHoster