පසුගිය වසර කිහිපය පුරාම කෘතිම බුද්ධි (AI) ක්ෂේත්‍රය මෙහෙයවනු ලැබුවේ එකම එක තරඟයක් විසිනි: එනම් ක්ලවුඩ් දත්ත මධ්‍යස්ථානවල (Cloud Data Centers) සිරවී තිබූ, පරාමිතීන් ට්‍රිලියන ගණනකින් සමන්විත දැවැන්ත Large Language Models (LLMs) ගොඩනැගීමේ තරඟයයි. නමුත් අප 2026 වසර හරහා ගමන් කරද්දී, එම ප්‍රවණතාවය දැවැන්ත ලෙස වෙනස් වී ඇත. එදිනෙදා කාර්ය ප්‍රවාහයන්, ව්‍යවසාය ඇප්ලිකේෂන් (Enterprise Apps) සහ දත්ත රහස්‍යතාවට මුල්තැන දෙන පරිගණකකරණය සඳහා Small Language Models (SLM) නිහඬවම පෙරමුණ ගනිමින් සිටින බව තාක්ෂණික ලෝකය මේ වන විට තේරුම් ගෙන තිබේ.

සෑම විමසුමක්ම (Query) වැඩි විදුලි බලයක් වැයවන ක්ලවුඩ් සර්වර් වෙත යොමු කරනවා වෙනුවට, පරාමිතීන් බිලියන 1 සිට බිලියන 7 දක්වා වූ සංයුක්ත මොඩලයන් (Compact Models) දැන් සෘජුවම ලැප්ටොප්, ස්මාර්ට්ෆෝන් සහ දේශීය සර්වර් (Local Servers) මත ධාවනය වේ — එමඟින් නිවැරදිභාවයට හානියක් නොකර ක්ෂණික පිළිතුරු ලබා දීමට ඒවාට හැකියාව ලැබී ඇත.

මොකක්ද මේ Small Language Model (SLM) කියන්නේ?

සාම්ප්‍රදායික LLM එකක් යනු පුරාණ ඉතිහාසයේ සිට ක්වොන්ටම් භෞතික විද්‍යාව දක්වා සියල්ල දන්නා “බහුශ්‍රැත” පද්ධතියක් වීමට උත්සාහ කරන එකකි. නමුත් SLM එකක් යනු යම් විශේෂිත කාර්යයකට පමණක් අතිශය සියුම් ලෙස සැකසූ මෙවලමකි (Hyper-specialized precision tool).

Model Compression, Speculative Decoding සහ උසස් තත්ත්වයේ Synthetic Training Data හි සිදුවූ දියුණුව හේතුවෙන්, නූතන SLMs මඟින් මතක ධාරිතාවයෙන් (Memory Footprint) ඉතා කුඩා ප්‍රමාණයක් භාවිතා කරමින්, 2024 යුගයේ පැවති දැවැන්ත Cloud LLMs වලට සමාන හෝ ඊටත් වඩා ඉහළ කාර්යසාධනයක් (Benchmark Scores) ලබා ගැනීමට සමත්ව ඇත.

2026 දී SLM තාක්ෂණය පෙරමුණ ගැනීමට හේතු

කුඩා, දේශීයව ක්‍රියාත්මක වන AI මොඩලයන් වෙත මෙම යොමුවීම හුදෙක් තාක්ෂණික කැමැත්තක් පමණක් නොවේ—එය සැබෑ ලෝකයේ ප්‍රධාන අවශ්‍යතා කිහිපයක් මඟින් මෙහෙයවනු ලබන්නකි:

1. පූර්ණ දත්ත රහස්‍යතාව සහ Zero Latency

SLM එකක් ඔබේ උපාංගයේ Neural Processing Unit (NPU) එක මත දේශීයව (Locally) ධාවනය වන විට, ඔබේ දත්ත ඔබේ RAM එකෙන් පිටතට යන්නේ නැත. මූල්‍ය වාර්තා, ආයතනික කේතයන් (Proprietary Codebases) සහ පුද්ගලික සටහන් සම්පූර්ණයෙන්ම Offline තත්ත්වයේ පවතී. තවද, දුරස්ථ සර්වර් එකකට අන්තර්ජාලය හරහා දත්ත යැවීමට සහ ලබාගැනීමට කාලයක් ගත නොවන බැවින්, කිසිදු පමාදයකින් තොරව (Zero Latency) ක්ෂණිකව පිළිතුරු උත්පාදනය වේ.

2. පිරිවැය සහ බලශක්ති පරිභෝජනය විශාල ලෙස අඩුවීම

එදිනෙදා සාමාන්‍ය කාර්යයන් මිලියන ගණනක් සඳහා දැවැන්ත Cloud API භාවිත කිරීම ආරම්භක ව්‍යාපාර (Startups) මෙන්ම විශාල ආයතනවලටද මූල්‍යමය වශයෙන් දරාගත නොහැකි දෙයකි. SLM මඟින් ස්ථාපනය කිරීමෙන් පසු භාවිත පිරිවැය (Inference Costs) බිංදුව දක්වා අඩු කරන අතර, අඩු විදුලි බලයක් වැය කරමින් දේශීය චිප්සෙට් මත ක්‍රියාත්මක වේ.

3. යම් ක්ෂේත්‍රයකට පමණක් ඇති අතිශය විශේෂඥතාව (Deep Domain Specialization)

වෛද්‍ය රෝග විනිශ්චය හෝ නීතිමය ලේඛන සඳහා පමණක් සියුම් ලෙස පුහුණු කරන ලද (Fine-tuned) පරාමිතීන් බිලියන 3ක මොඩලයක්, අදාළ ක්ෂේත්‍රය තුළදී පරාමිතීන් බිලියන 70ක සාමාන්‍ය Cloud Model එකකට වඩා නිරන්තරයෙන් ඉහළ දක්ෂතාවයක් පෙන්වයි. අනවශ්‍ය තොරතුරු ඉවත් කිරීම මඟින්, SLM එකක් තමන්ගේ සියලුම පරාමිතීන් යොදවන්නේ අදාළ නිශ්චිත කාර්යය සඳහා පමණි.

Cloud LLMs සහ On-Device SLMs අතර වෙනස (2026)

විශේෂාංගයCloud LLM (පරාමිතීන් ට්‍රිලියන ගණනක්)On-Device SLM (පරාමිතීන් 1B–7B)
ක්‍රියාත්මක වීමමධ්‍යගත දත්ත මධ්‍යස්ථාන / Cloudදේශීය NPUs, GPUs සහ Edge උපාංග
ප්‍රමාද කාලය (Latency)අන්තර්ජාල වේගය මත පදනම් වේ (200ms–2s+)ක්ෂණිකයි (මුලික ප්‍රතිචාරය <10ms)
රහස්‍යතාව (Privacy)තෙවැනි පාර්ශවීය සර්වර් මත සකසයි100% On-device, සම්පූර්ණයෙන්ම Offline
භාවිත පිරිවැයToken එකකට ගෙවිය යුතුය (API Fees)ස්ථාපනයට පසු අමතර ගාස්තු නැත
ප්‍රධාන භාවිතයපුළුල් තර්කනය, නිර්මාණාත්මක සිතීමකාර්යයන් ස්වයංක්‍රීය කිරීම, Local Coding

මෙම විප්ලවය පිටුපස ඇති තාක්ෂණය: Quantization සහ Speculative Decoding

ගුණාත්මක භාවයට හානියක් නොකර සාමාන්‍ය පරිශීලක දෘඩාංග (Hardware) තුළට මෙවැනි AI මොඩලයක් හැකිලීමට ඉංජිනේරුවන් සමත් වූයේ කෙසේද? ප්‍රධාන තාක්ෂණික සොයාගැනීම් දෙකක් මෙයට මග පාදන ලදී:

  • Low-Bit Quantization (4-bit සහ 2-bit): මොඩලයේ බර (Model Weights) සම්මත 16-bit floating points වල සිට 4-bit හෝ 2-bit integers දක්වා සංකෝචනය කරන්නේ නිරවද්‍යතාවයට සුළු හෝ හානියක් නොවන ලෙසයි. මෙහිදී GB 14ක විශාලත්වයකින් යුත් මොඩලයක්, සාමාන්‍ය RAM එකකට පහසුවෙන් ඇතුළත් කළ හැකි GB 2ක කුඩා ෆයිල් එකක් බවට පත්වේ.
  • Speculative Execution: නූතන මෙහෙයුම් පද්ධති (OS) මඟින් ඉක්මන් ප්‍රතිදානයන් අනුමාන කිරීමට SLM එකක් “Drafting Engine” එකක් ලෙස භාවිතා කරයි. සත්‍යාපනය අවශ්‍ය වූ විට පමණක් තරමක් විශාල දේශීය මොඩලයක් භාවිතා කිරීමෙන් වේගය සහ නිරවද්‍යතාවය යන දෙකම උපරිම කරයි.

Developers සහ තාක්ෂණ ලෝලීන්ට මෙයින් ලැබෙන අර්ථය

Pariganaka.com අනුගමනය කරන Developers ලාට සහ පාඨකයන්ට, SLM රැල්ල මඟින් සම්පූර්ණයෙන්ම නව නිර්මාණාත්මක දොරටු විවෘත වේ. බුද්ධිමත්, ස්වාධීන ඇප්ලිකේෂන් නිර්මාණය කිරීමට ඔබට තවදුරටත් ඩොලර් දහස් ගණනක Cloud Credits අවශ්‍ය නොවේ. පරිශීලකයාගේ Browser එක හෝ Desktop පරිසරය තුළම 100% ක්ම ක්‍රියාත්මක වන, ආරක්ෂිත මෘදුකාංග ඔබට දැන් නිර්මාණය කළ හැක.

මෙම වසරේදී නිෂ්පාදකයින් විසින් පාරිභෝගික උපාංගවල NPU TOPS (Tera Operations Per Second) ධාරිතාවය තවදුරටත් ඉහළ නංවද්දී, සාමාන්‍ය මෘදුකාංග සහ AI මෘදුකාංග අතර තිබූ රේඛාව සම්පූර්ණයෙන්ම මකී ගොස් ඇත. AI හි අනාගතය තවදුරටත් ඈත පිහිටි සර්වර් පද්ධතියක පාවෙමින් නැත—එය ක්‍රියාත්මක වන්නේ ඔබේ මේසය මත ඇති උපාංගයේ සිලිකන් චිප් එක මතමය.


Leave a Reply

Your email address will not be published. Required fields are marked *