25/08/2026
Why Attention Matters?
ပြီးခဲ့တဲ့ တစ်ခေါက်က ကျွန်တော်တို့ Attention Mechanism အကြောင်းကို မိတ်ဆက်အနေနဲ့ sharing လုပ်ပေးခဲ့တယ်။ ဒီနေ့မှာတော့ Attention Machanism ကြောင့်ဘယ်လိုပြဿနာတွေကို ဖြေရှင်းနိုင်ခဲ့ကြတယ် ဆိုတာနဲ့ ဘယ်လိုနည်းပညာတွေကိုသုံးပြီး ဖြေရှင်းခဲ့ကြတယ်ဆိုတာ ကို အတူတူလေ့လာသွားကြမယ်။
📍Recurrent Neural Network (RNN) ဆိုတာ အစဉ်လိုက်ဖြစ်နေတဲ့ (Sequential) ဒေတာတွေကို နားလည်ပြီး သင်ယူနိုင်အောင် ဒီဇိုင်းရေးဆွဲထားတဲ့ AI နယ်ပယ်ရဲ့ အရေးပါတဲ့ Neural Network Architecture တစ်မျိုး ဖြစ်ခဲ့ပါတယ်။ ဒါပေမယ့် နောက်ပိုင်းမှာ RNN ရဲ့ မှတ်သားနိုင်စွမ်းနဲ့ စွမ်းဆောင်ရည်ကို ပိုမိုကောင်းမွန်လာစေဖို့ Long Short-Term Memory (LSTM) နဲ့ Gated Recurrent Unit (GRU) တို့ကို ဆက်လက်တီထွင်ခဲ့ကြပါတယ်။ ဒီလိုမျိုး Architecture တွေကြောင့် Language Modeling နဲ့ Machine Translation လိုမျိုး Sequence Processing task တွေကို လုပ်ဆောင်ရာမှာ အကောင်းဆုံး နည်းပညာစံနှုန်းများအဖြစ် နှစ်ပေါင်းများစွာ သတ်မှတ်ခံခဲ့ရပါတယ်။
📍ဒီတီထွင်မှုတွေကို အခြေခံပြီး သုတေသီတွေက Recurrent Language Model တွေနဲ့ Encoder–Decoder Architecture တွေကို ဆက်လက်တိုးတက်လာအောင် တီထွင်ဖန်တီးခဲ့ကြပါတယ်။
Encoder–Decoder Architecture ဆိုတာ user က ထည့်ပေးလိုက်တဲ့ Input တစ်ခုကို သတ်မှတ်ထားတဲ့ format တစ်ခုအဖြစ်အရင်ဆုံးပြောင်းလည်းလိုက်ပြီး ရရှိလာတဲ့အချက်အလက်ကို အခြေခံကာ သင့်တော်တဲ့ Output အဖြစ်ပြောင်းလည်းပေးတဲ့ Model ဖွဲ့စည်းပုံတစ်ခု ဖြစ်တယ်။ သူ့ကို Machine Translation လို လုပ်ငန်းတွေမှာ အဓိက အသုံးပြုခဲ့ပါတယ်။
📍RNN model တွေရဲ့ အဓိကထူးခြားချက်ကတော့ Input (စကားစုတစ်စု) ထဲက စကားလုံးတွေကို တစ်ခုချင်းစီ အစဉ်လိုက် encoding လုပ်ဆောင်တာ ဖြစ်ပါတယ်။
စကားလုံးတစ်ခုကို တွက်ချက်တဲ့အခါမှာ အရင်က ရရှိထားတဲ့ အချက်အလက်(output)တွေကို Hidden State လို့ခေါ်တဲ့ ယာယီမှတ်ဉာဏ်ထဲမှာ သိမ်းဆည်းထားလေ့ရှိပြီး နောက်တစ်ခါတွက်ချက်ရာမှာ ပြန်လည်အသုံးပြုပါတယ်။ ဒါကြောင့် စာကြောင်းတစ်ကြောင်းရဲ့ အစပိုင်းမှာ ပါတဲ့ အချက်အလက်တွေကို နောက်ပိုင်းအထိ ထည့်သွင်းစဉ်းစားနိုင်ပေမယ့် encoding လုပ်ငန်းစဉ်တစ်ခုလုံးကတော့ အစဉ်လိုက် (Sequential) ပဲ ဆက်လက်လုပ်ဆောင်နေဆဲဖြစ်ပါတယ်။
📍ဒီလိုမျိုး စကားလုံးတစ်လုံးချင်းစီကို အစဉ်လိုက် တွက်ချက်ရတဲ့ သဘောတရားကြောင့် RNN ဟာ စကားလုံးအားလုံးကို တစ်ပြိုင်နက်တည်း တွက်ချက်ရာမှာ အခက်အခဲ ရှိနေခဲ့ပါတယ်။။
Sequence ပိုရှည်လာလေလေ process လုပ်ချိန် ပိုကြာလာလေလေ ဖြစ်ပြီး GPU Memory ကန့်သတ်ချက်ကြောင့် Batch Size (တစ်ကြိမ်တွင် တွက်ချက်ပေးနိုင်တဲ့ ဒေတာပမာဏ) ကိုလည်း အကန့်အသတ်နဲ့သာ အသုံးပြုနိုင်ပါတယ်။ ဒီအချက်က Model တစ်ခုရဲ့ အမြန်နှုန်းနဲ့ စွမ်းဆောင်ရည်အပေါ် သိသိသာသာ သက်ရောက်မှုရှိလာခဲ့ပါတယ်။ ဒီအားနည်းချက်ကို လျှော့ချနိုင်ဖို့ သုတေသီတွေဟာ Factorization Techniques နဲ့ Conditional Computation လို နည်းလမ်းအသစ်တွေကို ဆက်လက်ဖော်ထုတ်လာခဲ့ကြပါတယ်။
📍ဒီနည်းလမ်းတွေက တွက်ချက်မှုစွမ်းဆောင်ရည်နဲ့ Model Accuracy ကို တိုးတက်စေခဲ့ပေမယ့် RNN ရဲ့ အဓိကအခြေခံဖြစ်တဲ့ Sequential Processing သဘောတရားကိုတော့ မပြောင်းလဲနိုင်ခဲ့ပါဘူး။ တစ်နည်းအားဖြင့် RNN (Recurrent Neural Network)ဟာ စကားလုံးတစ်ခုကို မပြီးမချင်း နောက်တစ်ခုကို မစတင်နိုင်တဲ့ ပြဿနာက ဆက်လက်တည်ရှိနေဆဲ ဖြစ်ပါတယ်။ ဒီလိုအခြေအနေမှာ Attention Mechanism ဆိုတဲ့ နည်းပညာက Sequence Processing နယ်ပယ်မှာ အရေးပါတဲ့ အခန်းကဏ္ဍတစ်ခုအဖြစ် ပေါ်ထွက်လာခဲ့ပါတယ်။
ရှေ့မှာ ဆွေနွေးခဲ့သလို Attention Mechanism ဆိုတာ ထည့်သွင်းလိုက်တဲ့အချက်အလက် (input data) တွေထဲက အဓိကမကျတဲ့ အပိုင်းတွေကို လျစ်လျူရှုပြီး၊ အရေးကြီးဆုံးအပိုင်းတွေကိုပဲ အခြေအနေအလိုက် ပြောင်းလဲအာရုံစိုက်နိုင်ဖို့ Model ကို train ပေးထားတာ ဖြစ်ပါတယ်။။ ဒါကြောင့် အချက်အလက်နှစ်ခု ဘယ်လောက်ပဲ ဝေးကွာနေပါစေ သူတို့ရဲ့ ဆက်စပ်မှုကို ထိရောက်စွာ ဖမ်းယူနိုင်ပြီး Sequence Modeling နဲ့ Machine Translation အပါအဝင် လုပ်ငန်းအမျိုးမျိုးမှာ Model တွေရဲ့ စွမ်းဆောင်ရည်ကို သိသိသာသာ မြှင့်တင်ပေးနိုင်ခဲ့ပါတယ်။ သို့သော် အဲဒီအချိန်က Model အများစုမှာတော့ Attention ကို RNN (Recurrent Neural Network)နဲ့ တွဲဖက်အသုံးပြုခဲ့ကြပြီး သူ့ကို အစားထိုးတဲ့ Architecture အဖြစ် မသုံးခဲ့ကြသေးပါဘူး။
ဒါကြောင့် Transformer လို့ခေါ်တဲ့ Neural Network Architecture အသစ်ကို မိတ်ဆက်လာခဲ့ပါတယ်။
ဒီအကြောင်းကိုတော့ ကျွန်တော်တို့ နောက်ထပ် post တစ်ခုအနေနဲ့ ဆက်လက် ဆွေနွေးသွားမှာဖြစ်တယ်။
ကျွန်တော်တို့ knowledge center မှာလည်း ဝင်ရောက်ဖတ်ရှုနိုင်ပါတယ်။
https://optimustechnica.com/article/why-attention-matters
MR ROBOT (Myanmar Refining Operations & Building Optimus Technica)
-2017-attention-is-all-you-need-Paper