Chapter 25 of 25
Every key term, in one place
এই গ্লসারি বা শব্দকোষটি পুরো কোর্স জুড়ে ব্যবহৃত প্রতিটি গুরুত্বপূর্ণ শব্দ বা টার্মকে এক জায়গায় জড়ো করেছে — মেশিন লার্নিংয়ের মৌলিক আইডিয়া থেকে শুরু করে এর গাণিতিক বিল্ডিং ব্লক এবং মাল্টি-লেয়ার পারসেপ্ট্রন (MLP) ট্রেন ও টিউন করার সমস্ত পরিভাষা পর্যন্ত। প্রতিটি চ্যাপ্টার ঘেঁটে খোঁজার ঝামেলা এড়াতে এটিকে একটি বর্ণানুক্রমিক বা অ্যালফাবেটিকাল রেফারেন্স হিসেবে সাজানো হয়েছে যা আপনি খুব সহজেই সার্চ করতে পারবেন।
একটি অপ্টিমাইজার যা মোমেন্টামের (momentum) মসৃণ করার ক্ষমতার সাথে প্রতি-প্যারামিটারের লার্নিং রেটকে মানিয়ে নেওয়ার (adaptive learning rates) ক্ষমতাকে একত্রিত করে, সাথে একটি বায়াস-কারেকশন (bias-correction) ধাপ যুক্ত করে যা শুরুর দিকের আপডেটগুলোকে স্থিতিশীল ও সুশৃঙ্খল রাখে। বাস্তবে নিউরাল নেটওয়ার্ক ট্রেনের জন্য এটিই সবচেয়ে জনপ্রিয় ও ডিফল্ট পছন্দ।
একটি বিশাল ক্ষেত্র যা এমন সব মেশিন তৈরি করার সাথে জড়িত যা সাধারণত মানুষের বুদ্ধিমত্তার প্রয়োজন হয় এমন সব কাজ সম্পন্ন করতে পারে। মেশিন লার্নিং এবং এই কোর্সে শেখা অন্য সবকিছুই এই বড় ক্ষেত্রটির অন্তর্গত এক একটি পদ্ধতি বা অ্যাপ্রোচ।
একটি নিউরাল নেটওয়ার্কের সবচেয়ে মৌলিক কম্পিউটেশনাল বা হিসাবকারী একক: এটি ইনপুটের একটি সেট গ্রহণ করে, প্রতিটিকে একটি করে ওয়েট বা ওজন দিয়ে গুণ করে, সাথে একটি বায়াস যোগ করে, প্রাপ্ত ফলাফলকে একত্রিত করে এবং সেই যোগফলকে একটি নন-লিনিয়ার অ্যাক্টিভেশন ফাংশনের ভেতর দিয়ে প্রবাহিত করে।
চেইন রুল (chain rule) প্রয়োগ করে এবং আউটপুট লেয়ার থেকে শুরু করে ইনপুট লেয়ার পর্যন্ত উল্টো দিকে কাজ করার মাধ্যমে একটি মাল্টি-লেয়ার নেটওয়ার্কের প্রতিটি ওয়েটের সাপেক্ষে লসের গ্রেডিয়েন্ট অত্যন্ত দক্ষতার সাথে ক্যালকুলেট করার অ্যালগরিদম।
এমন একটি টেকনিক বা কৌশল যা বর্তমান মিনি-ব্যাচের স্ট্যাটিস্টিকস ব্যবহার করে একটি লেয়ারের ইনপুটগুলোকে নরমালাইজ করে, এবং তারপর দুটি লার্নেবল বা শিক্ষণীয় প্যারামিটার ব্যবহার করে ফলাফলটিকে স্কেল ও শিফট করে। এটি লেয়ারের ইনপুটগুলোকে একটি নির্দিষ্ট সীমার মধ্যে রেখে ট্রেনিংকে স্থিতিশীল ও দ্রুততর করে।
মডেলটি ডেটার আসল প্যাটার্ন ক্যাপচার করার জন্য খুব বেশি সহজ হওয়ার প্রবণতা (high bias বা আন্ডারফিটিং) এবং তার নির্দিষ্ট ট্রেনিং স্যাম্পলের খামখেয়ালিপনার প্রতি অতিরিক্ত সংবেদনশীল হওয়ার প্রবণতার (high variance বা ওভারফিটিং) মধ্যকার ভারসাম্য রক্ষা করা। বেশিরভাগ modeling-এর সিদ্ধান্তই মূলত এদের একটিকে কিছুটা বাড়িয়ে অন্যটিকে কমানোর চেষ্টা করে।
একাধিক ফাংশনের সমন্বয়ে তৈরি অন্য কোনো ফাংশনকে ডিফারেনসিয়েট বা ব্যবকলন করার ক্যালকুলাসের নিয়ম। এটিই সেই গাণিতিক ভিত্তি যা ব্যাকপ্রোপাগেশনকে সম্ভব করে তোলে, কারণ একটি নিউরাল নেটওয়ার্ক মূলত ফাংশনের একটি দীর্ঘ ধারাবাহিক সমন্বয় বা কম্পোজিশন ছাড়া আর কিছুই নয়।
এমন একটি ফাংশন যার গ্রাফের যেকোনো দুটি বিন্দুর মধ্যে টানা সরলরেখার নিচে গ্রাফটি কখনোই নেমে যায় না। একটি কনভেক্স ফাংশনকে অপ্টিমাইজ করা তুলনামূলকভাবে সহজ, কারণ এতে নিশ্চিতভাবে ঠিক একটিমাত্র গ্লোবাল মিনিমাম থাকে এবং কোনো বিভ্রান্তিকর লোকাল মিনিমাম থাকে না।
এমন একটি লস ফাংশন যা একটি আনুমানিক বা প্রেডিক্টেড প্রোবাবিলিটি ডিস্ট্রিবিউশন আসল লেবেলের ডিস্ট্রিবিউশন থেকে কতটা আলাদা তা পরিমাপ করে। এটি Maximum Likelihood Estimation থেকে প্রাকৃতিকভাবেই উঠে আসে এবং ক্লাসিফিকেশন সমস্যার জন্য এটিই স্ট্যান্ডার্ড বা মানদণ্ড লস।
মেশিন লার্নিংয়ের একটি সাবফিল্ড বা উপশাখা যা মাল্টি-লেয়ার নিউরাল নেটওয়ার্কের ওপর ভিত্তি করে গড়ে উঠেছে, যা ডেটার ক্রমানুসারী এবং লেয়ারে লেয়ারে স্বয়ংক্রিয়ভাবে ক্রমশ জটিল ও বিমূর্ত রিপ্রেজেন্টেশন (representations) শিখে নেয়।
দুটি ভেক্টরের অনুরূপ বা কারেসপন্ডিং মানগুলোর গুণফলের সমষ্টি। এটি ঠিক সেই অপারেশন যা একটি নিউরন তার ইনপুট ও ওয়েটগুলোকে একত্রিত করে একটিমাত্র ওয়েটেড সাম তৈরি করতে ব্যবহার করে।
একটি রেগুলারাইজেশন টেকনিক যা প্রতিটি ট্রেনিং ধাপে র্যান্ডমভাবে নিউরনের একটি নির্দিষ্ট অংশকে নিষ্ক্রিয় বা বন্ধ করে দেয়, যা নেটওয়ার্কটিকে কোনো একটি নির্দিষ্ট নিউরনের ওপর অতিরিক্ত নির্ভরশীল হওয়া থেকে বাঁচায় এবং এর জেনারেলাইজেশন ক্ষমতা বাড়ায়।
একটি বিশেষ ব্যর্থতা বা ফেইলিওর মোড যেখানে একটি ReLU নিউরনের প্রি-অ্যাক্টিভেশন চিরতরে নেগেটিভ বা ঋণাত্মক হয়ে যায়, ফলে এর আউটপুট এবং গ্রেডিয়েন্ট শূন্যে আটকে যায় — অর্থাৎ ট্রেনিংয়ের বাকি সময়ের জন্য নিউরনটি কার্যকরভাবে শেখা বন্ধ করে দেয়।
একটি রেগুলারাইজেশন স্ট্র্যাটেজি যা কোনো ভ্যালিডেশন সেটের ওপর পারফরম্যান্স ভালো হওয়া বন্ধ হয়ে গেলেই সাথে সাথে ট্রেনিং থামিয়ে দেয়, আগে থেকে নির্দিষ্ট করে রাখা ইপক পর্যন্ত ট্রেনিং চালিয়ে যাওয়ার বদলে।
একটি নির্দিষ্ট লেয়ারের প্রি-অ্যাক্টিভেশনের সাপেক্ষে লসের পার্শিয়াল ডেরিভেটিভ (partial derivative)। এটিই ব্যাকপ্রোপাগেশনের প্রতিটি লেয়ারে ক্যালকুলেট করা প্রধান মান, এবং প্রতিটি ওয়েটের গ্রেডিয়েন্ট সরাসরি এটার ওপর ভিত্তি করেই বের হয়।
একটি র্যান্ডম ভ্যারিয়েবলকে যদি আপনি বারবার পর্যবেক্ষণ করতে পারতেন, তবে দীর্ঘ মেয়াদে এটি যে গড় বা অ্যাভারেজ মানটি গ্রহণ করত, যেখানে প্রতিটি ফলাফলের সম্ভাব্যতা বা লাইকলিহুড দিয়ে গুণ করা থাকে।
ইনপুট লেয়ার থেকে শুরু করে আউটপুট লেয়ার পর্যন্ত সিকোয়েন্স বা ক্রমানুসারে ইনপুটকে প্রতিটি লেয়ারের ভেতর দিয়ে প্রবাহিত করার মাধ্যমে একটি নেটওয়ার্কের প্রেডিকশন বা অনুমান ক্যালকুলেট করার প্রক্রিয়া।
একটি ফাংশনের প্রতিটি ইনপুট ভ্যারিয়েবলের সাপেক্ষে নেওয়া পার্শিয়াল ডেরিভেটিভের সমন্বয়ে গঠিত ভেক্টর। এটি সেই দিকটি নির্দেশ করে যেদিকে ফাংশনটি সবচেয়ে দ্রুত বৃদ্ধি পায় — আর ঠিক এই কারণেই গ্রেডিয়েন্ট ডিসেন্ট লস কমানোর জন্য এর ঠিক উল্টো বা বিপরীত দিকে অগ্রসর হয়।
একটি পুনরাবৃত্তিমূলক বা ইটারেটিভ অপ্টিমাইজেশন অ্যালগরিদম যা বারবার লস ফাংশনের গ্রেডিয়েন্টের বিপরীত দিকে একটি মডেলের প্যারামিটারগুলোকে সামান্য ধাক্কা দেয়, যা ধীরে ধীরে লস কমিয়ে আনে।
ReLU-পরিবারের অ্যাক্টিভেশন ফাংশনগুলোর জন্য বিশেষভাবে টিউন করা একটি ওয়েট ইনিশিয়ালাইজেশন স্কিম, যা অনেকগুলো লেয়ারের ভেতর দিয়ে যাওয়ার সময়ও অ্যাক্টিভেশন এবং গ্রেডিয়েন্টের স্কেলকে স্থিতিশীল রাখতে ডিজাইন করা হয়েছে।
যেকোনো কনফিগারেশন পছন্দ — যেমন লার্নিং রেট, ব্যাচ সাইজ, অথবা হিডেন লেয়ারের সংখ্যা — যা ট্রেনিং শুরু করার আগে নিজে হাতে সেট করতে হয়, ডেটা থেকে স্বয়ংক্রিয়ভাবে শেখার বদলে।
একটি হাইপারপ্যারামিটার যা নিয়ন্ত্রণ করে প্রতিটি আপডেটে গ্রেডিয়েন্ট ডিসেন্ট ঠিক কতটা বড় পদক্ষেপ বা ধাপ নেবে। এটি খুব ছোট হলে ট্রেনিং অনেক ধীর হয়ে যায়; খুব বড় হলে এটি লক্ষ্য অতিক্রম করতে পারে বা পুরোপুরি ডাইভার্জ (diverge) করতে পারে।
একটি ডেটাসেটের এমন একটি বৈশিষ্ট্য যেখানে এর দুটি ক্লাসকে একটিমাত্র সরলরেখা (অথবা আরও সাধারণভাবে, একটি হাইপারপ্লেন) দিয়ে নিখুঁতভাবে বিভক্ত করা যায়। একটি পারসেপ্ট্রন সফল হওয়ার জন্য ঠিক এই শর্তটিই প্রয়োজন।
কৃত্রিম বুদ্ধিমত্তা বা AI-র একটি সাবফিল্ড যেখানে একটি সিস্টেম কোনো মানুষের লিখে দেওয়া নির্দিষ্ট নিয়ম অনুসরণ করার বদলে সরাসরি ডেটা ও অভিজ্ঞতা থেকে শিখে কোনো কাজের ওপর নিজের পারফরম্যান্স উন্নত করে।
সংখ্যার একটি চারকোনা গ্রিড, যা এই курс জুড়ে লিনিয়ার ট্রান্সফরমেশনকে রিপ্রেজেন্ট করতে ব্যবহৃত হয়েছে — যার মধ্যে সবচেয়ে গুরুত্বপূর্ণ হলো একটি লেয়ারের সাথে তার পরের লেয়ারের সংযোগকারী ওয়েটের সম্পূর্ণ সেটটি।
his পদ্ধতিতে মডেলের প্যারামিটার বেছে নেওয়া যা মডেলের অধীনে পর্যবেক্ষণ করা ট্রেনিং ডেটার ঘটার সম্ভাবনাকে সর্বোচ্চ করে তোলে। এটিই সেই তাত্ত্বিক যুক্তি যা প্রমাণ করে কেন ক্লাসিফিকেশন সমস্যার জন্য ক্রস-এন্ট্রপি লস একটি স্বাভাবিক পছন্দ।
এক বা একাধিক হিডেন লেয়ার এবং একটি আউটপুট লেয়ার দিয়ে গঠিত একটি ফিডফরওয়ার্ড নিউরাল নেটওয়ার্ক, যা ব্যাকপ্রোপাগেশন ব্যবহার করে শুরু থেকে শেষ পর্যন্ত ট্রেন করা হয়।
একটি ফাংশন যা কোনো ভেক্টরের আকার বা দৈর্ঘ্য পরিমাপ করে। L1 এবং L2 নর্ম হলো মেশিন লার্নিংয়ে এবং রেগুলারাইজেশনে ওতপ্রোতভাবে জড়িত দুটি নর্মের রূপ।
যখন একটি মডেল তার ট্রেনিং ডেটাকে — যার মধ্যে ওই নির্দিষ্ট স্যাম্পলের নয়েজ ও খামখেয়ালিপনাও রয়েছে — এতটাই নিখুঁতভাবে ফিট করে ফেলে যে এটি নতুন ও না দেখা ডেটার ওপর ভালো পারফর্ম বা জেনারেলাইজ করতে ব্যর্থ হয়।
একটি কৃত্রিম নিউরনের সবচেয়ে আদিম বা শুরুর দিকের শিক্ষণীয় মডেল: একটি লিনিয়ার বাইনারি ক্লাসিফায়ার যা পারসেপ্ট্রন লার্নিং রুল ব্যবহার করে ট্রেন করা হয়, যা শুধুমাত্র ভুল করার পরই তার ওয়েট বা ওজনকে আপডেট করে।
একটি ফাংশনের পৃষ্ঠের এমন একটি বিন্দু যা কিছু কিছু দিকে ওপরের দিকে এবং অন্য কিছু দিকে নিচের দিকে বেঁকে যায়, কোনো পরিষ্কার মিনিমাম বা ম্যাক্সিমাম হওয়ার বদলে। নিউরাল নেটওয়ার্ক ট্রেনের জন্য ব্যবহৃত উচ্চ-মাত্রার নন-কনভেক্স লস সারফেসগুলোতে এগুলো খুব সাধারণ বাধা।
এমন একটি অ্যাক্টিভেশন ফাংশন যা raw স্কোরের (logits) একটি ভেক্টরকে একাধিক ক্লাসের মধ্যে একটি বৈধ প্রোবাবিলিটি ডিস্ট্রিবিউশনে রূপান্তরিত করে, যা নিশ্চিত করে যে প্রতিটি আউটপুট পজিটিভ এবং তাদের সবার যোগফল ঠিক এক (1) হয়।
মেশিন লার্নিংয়ের একটি প্যারাডাইম বা ধরণ যেখানে একটি মডেল লেবেলযুক্ত ইনপুট-আউটপুট জোড়ার একটি ট্রেনিং সেট ব্যবহার করে ইনপুট থেকে আউটপুটের ম্যাপিং শিখে নেয়।
যখন একটি মডেল ডেটার পেছনের আসল প্যাটার্নটি ক্যাপচার করার জন্য অতিরিক্ত সহজ বা সরল হয়, যার ফলে এটি স্বয়ং ট্রেনিং সেটের ওপরই খুব বাজে পারফর্ম করে।
এমন একটি থিওরেম বা উপপাদ্য যা প্রমাণ করে যে একটি বড় যথেষ্ট একক-হিডেন-লেয়ারের নেটওয়ার্ক তাত্ত্বিকভাবে যেকোনো বাউন্ডেড ইনপুট ডোমেইনের ওপর যেকোনো কন্টিনিউয়াস ফাংশনকে অ্যাপ্রক্সিমেট বা অনুমান করতে পারে। এটি কেবল কী থাকা সম্ভব তার একটি গ্যারান্টি দেয়, ট্রেনিং বাস্তবে সেটি খুঁজে পাবে কি না তার কোনো নিশ্চয়তা দেয় না।
স্যাচুরেটিং অ্যাক্টিভেশন ফাংশন ব্যবহার করে এমন অনেকগুলো লেয়ারের ভেতর দিয়ে ব্যাকপ্রোপাগেট করার সময় গ্রেডিয়েন্টগুলোর এক্সপোনেনশিয়ালি ছোট হয়ে যাওয়ার প্রবণতা, যা নেটওয়ার্কের শুরুর দিকের লেয়ারগুলোর শেখার গতি একদম থামিয়ে দেয়।
একটি র্যান্ডম ভ্যারিয়েবলের সম্ভাব্য মানগুলো তার প্রত্যাশিত বা এক্সপেক্টেড মানের চারপাশে কতটা ছড়িয়ে আছে তার পরিমাপ।
সংখ্যার একটি সুশৃঙ্খল তালিকা, যা এই কোর্স জুড়ে স্পেস বা শূন্যে একটি নির্দিষ্ট বিন্দু, দিক বা ফিচারের সেট রিপ্রেজেন্ট করতে ব্যবহৃত হয়েছে।
প্রতিটি আপডেট ধাপে সরাসরি গুণের মাধ্যমে ওয়েটগুলোকে শূন্যের দিকে ছোট করে আনা। সাধারণ স্টোকাস্টিক গ্রেডিয়েন্ট ডিসেন্টের অধীনে, এটি গাণিতিকভাবে L2 রেগুলারাইজেশনের হুবহু সমতুল্য।
সিগময়েড এবং ট্যানএইচ (tanh) অ্যাক্টিভেশন ফাংশনগুলোর জন্য বিশেষভাবে টিউন করা একটি ওয়েট ইনিশিয়ালাইজেশন স্কিম, যা নেটওয়ার্কের ভেতর দিয়ে প্রবাহিত হওয়ার সময় অ্যাক্টিভেশন এবং গ্রেডিয়েন্টের ভ্যারিয়েন্সকে সামঞ্জস্যপূর্ণ রাখতে ডিজাইন করা হয়েছে।
এমন একটি ফাংশনের ক্লাসিক উদাহরণ যার ক্লাসগুলোকে কোনো একটিমাত্র সরলরেখা দিয়ে বিভক্ত করা যায় না, যা একটি একক-লেয়ারের পারসেপ্ট্রন ঠিক কী কী শিখতে পারে না তার পাঠ্যপুস্তকীয় প্রমাণ।