আগের পাঠে মেশিন লার্নিং একটি উচ্চ-স্তরে আলোচিত হয়েছিল: তথ্য প্রবেশ করে, প্যাটার্ন খুঁজে পাওয়া যায়, পূর্বাভাস বের হয়। এই পাঠে আমরা ChatGPT, Gemini, আর Claude-এর মতো টুলের পেছনের নির্দিষ্ট প্রযুক্তি নিয়ে আরও এক স্তর গভীরে যাব — লার্জ ল্যাঙ্গুয়েজ মডেল (LLM) — আর ব্যাখ্যা করব এরা ঠিক কীভাবে "লিখতে" শেখে।
LLM বিশাল টেক্সট ডেটাসেটে প্রশিক্ষিত হয় — ইন্টারনেট, বই, উইকিপিডিয়া, কোড রিপোজিটরি, আর গবেষণাপত্র থেকে টানা বিপুল পরিমাণ টেক্সট। টেক্সটকে টোকেন-এ ভাঙা হয়, প্রতিটি প্রায় ¾ শব্দের ("Hello" একটি টোকেন, "ChatGPT" প্রায় দুটি) — বৃহত্তম মডেলগুলো লক্ষ কোটি টোকেন পরিমাণ ডেটাসেটে প্রশিক্ষিত হয়।
প্রশিক্ষণ কাজ করে একটি বাক্যের শেষ শব্দ লুকিয়ে রেখে আর মডেলকে সেটি অনুমান করতে বলে:
ইনপুট: "The capital of France is ___"
মডেল পূর্বাভাস দেয়: "Paris" → সঠিক, শক্তিশালী করা হয়
"Berlin" → ভুল, সংশোধন করা হয়
"Rome" → ভুল, সংশোধন করা হয়এটি লক্ষ কোটি উদাহরণ জুড়ে শত কোটি বার ঘটে। প্রতিবার মডেল ভুল করলে, এটি তার অভ্যন্তরীণ সেটিংস — যাকে বলা হয় প্যারামিটার — সামান্য সমন্বয় করে যাতে পরেরবার আরও ভালো অনুমান করতে পারে। যথেষ্ট পুনরাবৃত্তির পর, মডেলটি কার্যকরভাবে মানুষের ভাষার প্যাটার্ন সেই প্যারামিটারগুলোতে সংকুচিত করে ফেলেছে।
শুধু প্রাথমিক প্রশিক্ষণ এমন একটি মডেল তৈরি করে যা টেক্সট সম্পূর্ণ করে — এমন একটি মডেল নয় যা অগত্যা সহায়ক, ভদ্র, বা কথা বলার জন্য নিরাপদ। সেই অতিরিক্ত স্তরটি আসে Reinforcement Learning from Human Feedback (RLHF) থেকে: মানুষ পর্যালোচকরা মডেলের উত্তরগুলোকে রেটিং দেন ("সহায়ক আর নিরাপদ" বনাম "ক্ষতিকর বা ভুল"), আর মডেলটি আরও প্রশিক্ষিত হয় যাতে মানুষ আসলে যে ধরনের উত্তর পছন্দ করেছেন তা তৈরি করে। এই ধাপটিই, ইন্টারনেটের কাঁচা টেক্সট নয়, ChatGPT-কে কথোপকথনমূলক আর ভদ্র মনে করায়, শুধু যা পরিসংখ্যানগতভাবে সম্ভাব্য তা পূর্বাভাস দেওয়ার বদলে।
আপনি যখন একটি বার্তা টাইপ করেন, মডেল তার উত্তর একবারে একটি টোকেন করে তৈরি করে — প্রতিটি পরিসংখ্যানগতভাবে বেছে নেওয়া হয়, আগে যা কিছু এসেছে তার ভিত্তিতে পরিসংখ্যানগতভাবে সবচেয়ে সম্ভাব্য পরের টোকেন হিসেবে, একটি "সঠিক" উত্তর হিসেবে খুঁজে বের করা নয়। এটি ব্যাখ্যা করে আপনি হয়তো যে দুটো জিনিস লক্ষ্য করেছেন:
যে মানসিক মডেলটি আসলে গুরুত্বপূর্ণ
একটি LLM এমন কোনো ডেটাবেস নয় যা তথ্য খুঁজে বের করে। এটি একটি অত্যন্ত পরিশীলিত প্যাটার্ন-সম্পূর্ণকরণ ইঞ্জিন — ঠিক যেভাবে আপনি কোনো ডেটাবেস না দেখেই "Mary had a little ___" সম্পূর্ণ করতে পারবেন, শুধু আগে সেই প্যাটার্ন দেখার কারণে। এই কারণেই LLM লেখায় এত ভালো, আর নির্ভুল পাটিগণিত বা অস্পষ্ট তথ্যে এত অনির্ভরযোগ্য।
| শব্দ | এর মানে কী |
|---|---|
| টোকেন | একটি মডেল প্রসেস করে এমন টেক্সটের সবচেয়ে ছোট অংশ — প্রায় ¾ শব্দ। |
| কনটেক্সট উইন্ডো | একটি মডেল একবারে কতটা টেক্সট "দেখতে" পারে। এই সীমার বাইরে, এটি কার্যকরভাবে কথোপকথনের আগের অংশ ভুলে যায়। |
| প্যারামিটার | প্রশিক্ষণের সময় সমন্বয় করা অভ্যন্তরীণ সংখ্যা — বড় মডেলে প্রায়ই বিলিয়নের কোঠায়। মোটামুটিভাবে, বেশি প্যারামিটার মানে প্যাটার্ন শেখার বেশি ক্ষমতা। |
| টেম্পারেচার | র্যান্ডমনেস নিয়ন্ত্রণকারী একটি সেটিং। কম টেম্পারেচার প্রতিবার সবচেয়ে সম্ভাব্য শব্দ বেছে নেয় (পুনরাবৃত্তিমূলক, অনুমানযোগ্য); বেশি টেম্পারেচার আরও বৈচিত্র্য আর সৃজনশীলতার সুযোগ দেয়। |
| ফাইন-টিউনিং | একটি ইতিমধ্যে-প্রশিক্ষিত মডেল নিয়ে সেটিকে একটি সংকীর্ণ, নির্দিষ্ট ডেটাসেটে আরও প্রশিক্ষণ দেওয়া — একজন সাধারণ ডাক্তার অতিরিক্ত প্রশিক্ষণ নিয়ে একটি নির্দিষ্ট ক্ষেত্রে বিশেষজ্ঞ হওয়ার মতো। |
| হ্যালুসিনেশন | যখন একটি মডেল সম্পূর্ণ আত্মবিশ্বাসের সাথে বাস্তবিকভাবে ভুল কিছু বলে — সম্ভাব্য টেক্সট পূর্বাভাস দেওয়ার সরাসরি ফলাফল, তথ্য যাচাই করা নয়। |
এটি বোঝা — যে একটি LLM জানে না, পূর্বাভাস দেয় — AI টুল ভালোভাবে ব্যবহার করার জন্য সবচেয়ে কার্যকর মানসিক মডেল। পরের পাঠে এটি ব্যবহারিকভাবে কাজে লাগানো হবে: আজ উপলব্ধ প্রধান AI মডেলগুলো তুলনা করা, আর একটি নির্দিষ্ট কাজের জন্য কোনটি আসলে উপযুক্ত তা জানা।