AI মডেলের পারফরম্যান্সে বিভ্রম, ৩ সপ্তাহের গবেষণা বৃথা যেতে পারে
একটি দল তিন সপ্তাহ ধরে ভেবেছিল তাদের AI জাজ খারাপ হচ্ছে। কিন্তু বুটস্ট্র্যাপিংয়ের পর দেখা গেল, পুরো পতনটাই ছিল পরিসংখ্যানগত বিভ্রম। ছোট নমুনায় বড় সিদ্ধান্ত নেওয়ার বিপদ নিয়ে নতুন সতর্কবার্তা।
একটি দল তিন সপ্তাহ ধরে ভেবেছিল তাদের AI জাজ খারাপ হচ্ছে। কিন্তু বুটস্ট্র্যাপিংয়ের পর দেখা গেল, পুরো পতনটাই ছিল পরিসংখ্যানগত বিভ্রম। ছোট নমুনায় বড় সিদ্ধান্ত নেওয়ার বিপদ নিয়ে নতুন সতর্কবার্তা।
AI মডেলের পারফরম্যান্স যাচাই করতে গিয়ে একটি গবেষণা দল তিন সপ্তাহ ধরে একটি ভুল গল্প বিশ্বাস করেছিল। তারা দেখেছিল, তাদের LLM জাজ এবং মানুষের লেবেলের মধ্যে চুক্তির মাত্রা (Cohen’s kappa) প্রতি সপ্তাহে কমছে — 0.55, তারপর 0.49, তারপর 0.44। দলটি সঙ্গে সঙ্গে খুঁজতে শুরু করলো কী কারণে জাজটি ভেঙে পড়েছে।
কিন্তু যখন তারা প্রতিটি সাপ্তাহিক সংখ্যার ওপর বুটস্ট্র্যাপিং পদ্ধতিতে কনফিডেন্স ইন্টারভাল তৈরি করলো, তখন পুরো ছবি পাল্টে গেল। তাদের নমুনার আকার ছিল সপ্তাহে মাত্র 50টি ট্রেস। সেই আকারে 95 শতাংশ কনফিডেন্স ইন্টারভালের পরিধি দাঁড়ায় প্রায় প্লাস বা মাইনাস 0.15। অর্থাৎ তিন সপ্তাহের সবগুলো অনুমানই একে অপরের কনফিডেন্স ইন্টারভালের ভেতরে পড়ে গেল। যে পতন নিয়ে দলটি দুই দিন ধরে মাথা ঘামিয়েছিল, সেটি বাস্তব ছিল না।
এই ঘটনাটি dev.to ML প্ল্যাটফর্মে প্রকাশিত একটি গবেষণা প্রতিবেদনের কেন্দ্রবিন্দু। প্রতিবেদনটি স্পষ্টভাবে দেখিয়েছে, ছোট নমুনা সাইজে পয়েন্ট এস্টিমেট (একক সংখ্যা) দেখে কোনো ট্রেন্ড বা সিদ্ধান্ত নেওয়া মারাত্মক ভুল হতে পারে। পরিসংখ্যানগত কঠোরতা ছাড়া AI ইভালুয়েশন মিথ্যা সিদ্ধান্তে নিয়ে যেতে পারে।
বাংলাদেশের কনটেক্সটে এই গবেষণার গুরুত্ব অপরিসীম। দেশের স্টার্টআপ, ফ্রিল্যান্সার এবং শিক্ষার্থীরা প্রতিদিন ছোট ডেটাসেট নিয়ে কাজ করে। অনেক ডেভেলপার নিজেরাই LLM জাজ তৈরি করে প্রোডাক্টের কোয়ালিটি নিশ্চিত করতে চায়। কিন্তু 50 বা 100টি নমুনার ওপর ভিত্তি করে কোনো মডেলকে ভালো বা খারাপ বলে ফেলা ভুল হতে পারে। বুটস্ট্র্যাপিংয়ের মতো সহজ পদ্ধতি ব্যবহার করলেই এই বিভ্রম এড়ানো সম্ভব।
গবেষকরা বলছেন, শুধু পয়েন্ট এস্টিমেট নয়, সবসময় কনফিডেন্স ইন্টারভাল রিপোর্ট করা উচিত। বিশেষ করে যখন নমুনা আকার ছোট। একটি সাধারণ নিয়ম হলো — নমুনা যত ছোট, কনফিডেন্স ইন্টারভাল তত চওড়া। আর চওড়া ইন্টারভাল মানে সিদ্ধান্ত নেওয়ার আগে আরও ডেটা জমা করা জরুরি।
ভবিষ্যতে AI ইভালুয়েশন রিপোর্টে কনফিডেন্স ইন্টারভাল না থাকলে সেগুলোকে সন্দেহের চোখে দেখার পরামর্শ দিচ্ছেন বিশেষজ্ঞরা। কারণ একটি সংখ্যা কখনোই পুরো গল্প বলে না।
আরও পড়ুন
এই সংবাদটি আন্তর্জাতিক সূত্রের তথ্য অবলম্বনে AI-সহায়তায় বাংলায় উপস্থাপন ও বাংলাদেশের প্রেক্ষাপটে সম্পাদিত। মূল তথ্যের জন্য নিচের সূত্র দেখুন।
মূল প্রতিবেদন: dev.to ML
সোর্স দেখুন ↗মন্তব্য০
লোড হচ্ছে...