LIVE
ইন্ডাস্ট্রিDeepSeek V4 Flash-এ পরপর দুইটি আউটেজ, মাল্টি-প্রোভাইডার ফেইলওভারের প্রয়োজনীয়তাটুলমোবাইল অ্যাপে AI সংযুক্তির নতুন পথ দেখাল Oxlo.ai ও FastAPIমডেলQwen3.8-Max তিনটি বেঞ্চমার্কে Claude-কে হারিয়েছে, কিন্তু পুরো গল্পটা ততটা সহজ নয়গবেষণাসোশ্যাল মিডিয়া সেন্টিমেন্ট বিশ্লেষণে LLM-এর সাফল্য ও উৎপাদন-স্তরের চ্যালেঞ্জটুলকাস্টম AI এজেন্ট এখন আপনার স্থায়ী এডিটর হতে পারে, জানুন পদ্ধতিটুলAI লেখাকে মানবিক করুন ফ্রিতে, কোনো সাবস্ক্রিপশন ছাড়াইটুলAI ডিটেক্টর মেশিনে লেখা চেনে ভুল করে, বিকল্প কীভাবে নেবেনটুলAI এজেন্টের মান যাচাইয়ে ৪টি সিদ্ধান্ত, ফ্রেমওয়ার্ক নয়ইন্ডাস্ট্রিMicrosoft-এর নিজস্ব AI মডেল ও চিপে বদলে যাবে এন্টারপ্রাইজ বাজারইন্ডাস্ট্রিAI ডেভেলপমেন্টে খরচ বদলালো Novita ও StreamLake, বাজেটে বড় প্রভাব!গবেষণাক্লদ স্যান্ডবক্স ভেঙে বেরিয়ে গেল, ৩ কোম্পানি টেরই পায়নি!টুলএক API-তে সব AI মডেল! Bifrost গেটওয়েতে ফ্রিল্যান্সারদের সময় বাঁচবে ৩ গুণইন্ডাস্ট্রিDeepSeek V4 Flash-এ পরপর দুইটি আউটেজ, মাল্টি-প্রোভাইডার ফেইলওভারের প্রয়োজনীয়তাটুলমোবাইল অ্যাপে AI সংযুক্তির নতুন পথ দেখাল Oxlo.ai ও FastAPIমডেলQwen3.8-Max তিনটি বেঞ্চমার্কে Claude-কে হারিয়েছে, কিন্তু পুরো গল্পটা ততটা সহজ নয়গবেষণাসোশ্যাল মিডিয়া সেন্টিমেন্ট বিশ্লেষণে LLM-এর সাফল্য ও উৎপাদন-স্তরের চ্যালেঞ্জটুলকাস্টম AI এজেন্ট এখন আপনার স্থায়ী এডিটর হতে পারে, জানুন পদ্ধতিটুলAI লেখাকে মানবিক করুন ফ্রিতে, কোনো সাবস্ক্রিপশন ছাড়াইটুলAI ডিটেক্টর মেশিনে লেখা চেনে ভুল করে, বিকল্প কীভাবে নেবেনটুলAI এজেন্টের মান যাচাইয়ে ৪টি সিদ্ধান্ত, ফ্রেমওয়ার্ক নয়ইন্ডাস্ট্রিMicrosoft-এর নিজস্ব AI মডেল ও চিপে বদলে যাবে এন্টারপ্রাইজ বাজারইন্ডাস্ট্রিAI ডেভেলপমেন্টে খরচ বদলালো Novita ও StreamLake, বাজেটে বড় প্রভাব!গবেষণাক্লদ স্যান্ডবক্স ভেঙে বেরিয়ে গেল, ৩ কোম্পানি টেরই পায়নি!টুলএক API-তে সব AI মডেল! Bifrost গেটওয়েতে ফ্রিল্যান্সারদের সময় বাঁচবে ৩ গুণ
হোম/নিউজ/রিসার্চ
রিসার্চ৫ মিনিট পড়া

OpenAI-র অডিটে ধরা: SWE-Bench Pro-র ৩০% টাস্ক ভাঙা, সুপারিশ প্রত্যাহার

OpenAI তাদের নিজস্ব অডিটে দেখতে পেয়েছে যে SWE-Bench Pro-র প্রায় 30% টাস্কই ত্রুটিপূর্ণ। ফলে প্রতিষ্ঠানটি আগের দেওয়া সুপারিশ প্রত্যাহার করে নিয়েছে। এই ঘটনা AI মডেল মূল্যায়নের বিশ্বাসযোগ্যতা নিয়ে বড় প্রশ্ন তুলেছে।

d
সম্পাদকীয় টিম
স্টাফ রিপোর্টার · ৪৫ দিন আগে · সূত্র: dev.to AI
OpenAI-র অডিটে ধরা: SWE-Bench Pro-র ৩০% টাস্ক ভাঙা, সুপারিশ প্রত্যাহার

OpenAI তাদের নিজস্ব অডিটে দেখতে পেয়েছে যে SWE-Bench Pro-র প্রায় 30% টাস্কই ত্রুটিপূর্ণ। ফলে প্রতিষ্ঠানটি আগের দেওয়া সুপারিশ প্রত্যাহার করে নিয়েছে। এই ঘটনা AI মডেল মূল্যায়নের বিশ্বাসযোগ্যতা নিয়ে বড় প্রশ্ন তুলেছে।

ওপেনএআই (OpenAI) একটি বড় ধরনের স্বীকারোক্তি দিয়েছে। প্রতিষ্ঠানটির গবেষণা দল জানিয়েছে, SWE-Bench Pro নামক বেঞ্চমার্কের প্রায় 30 শতাংশ টাস্কই ভাঙা বা ত্রুটিপূর্ণ। এই বেঞ্চমার্কটি তৈরি করা হয়েছিল এজেন্টিক কোডিংয়ের (agentic coding) বাস্তবসম্মত ও দীর্ঘমেয়াদি কাজের দক্ষতা যাচাই করার জন্য। কিন্তু অডিটে দেখা গেছে, 731টি টাস্কের মধ্যে প্রায় 219টিতেই নকশাগত সমস্যা ও তথ্যগত দূষণ (contamination) রয়েছে।

এই ঘটনার গুরুত্ব অনেক। কারণ কিছুদিন আগেই ওপেনএআই তাদের আগের বেঞ্চমার্ক 'SWE-Bench Verified'-এর সুপারিশ প্রত্যাহার করে নিয়েছিল। তখন তারা দাবি করেছিল, দূষণ ও নকশার ত্রুটির কারণেই এটি প্রত্যাহার করা হয়েছে। এরপর তারা SWE-Bench Pro-কে নতুন ও নির্ভরযোগ্য বিকল্প হিসেবে সুপারিশ করে। কিন্তু সেই সুপারিশটিও এখন ধুলোয় মিশে গেছে।

গবেষণা দল তাদের সাম্প্রতিক এক প্রতিবেদনে বিস্তারিত তথ্য প্রকাশ করেছে। তারা বলেছে, টাস্কগুলোর মধ্যে এমন কিছু সমস্যা রয়েছে যা মডেলের প্রকৃত দক্ষতা যাচাই করতে বাধা দেয়। উদাহরণস্বরূপ, কিছু টাস্কের উত্তর আগে থেকেই প্রশিক্ষণ ডেটাতে ছিল। আর কিছু টাস্কের প্রশ্নই এতটাই অস্পষ্ট ছিল যে সঠিক উত্তর দেওয়া কার্যত অসম্ভব ছিল। এই কারণে ওপেনএআই আনুষ্ঠানিকভাবে তাদের পূর্বের সুপারিশ প্রত্যাহার করে নিয়েছে।

AI মডেল মূল্যায়নের জন্য বেঞ্চমার্ক অত্যন্ত গুরুত্বপূর্ণ। ডেভেলপার ও গবেষকেরা বুঝতে চান, তাদের তৈরি মডেল কতটা ভালো কাজ করে। কিন্তু যদি বেঞ্চমার্ক নিজেই ত্রুটিপূর্ণ হয়, তাহলে তার ফলাফলের ওপর আস্থা রাখা যায় না। এই ঘটনা AI শিল্পে একটি বড় প্রশ্ন তুলে দিয়েছে। বর্তমানে ব্যবহৃত অন্যান্য বেঞ্চমার্ক কতটা নির্ভরযোগ্য?

বাংলাদেশের প্রযুক্তি অঙ্গনের জন্যও এই খবর গুরুত্বপূর্ণ। দেশের ডেভেলপার, ফ্রিল্যান্সার ও শিক্ষার্থীরা প্রায়ই বিভিন্ন AI মডেলের তুলনা করতে এই বেঞ্চমার্কের ওপর নির্ভর করে। যদি বেঞ্চমার্কই ঠিক না থাকে, তাহলে মডেল নির্বাচনের সিদ্ধান্ত ভুল হতে পারে। বিশেষ করে যারা সফটওয়্যার ডেভেলপমেন্টে AI ব্যবহার করেন, তাদের জন্য এটি একটি বড় সতর্কবার্তা।

ওপেনএআই এখন নতুন করে ভাবছে। তারা বলেছে, ভবিষ্যতে আরও কঠোর অডিট প্রক্রিয়া চালু করা হবে। কিন্তু এই ঘটনা AI সম্প্রদায়ের জন্য একটি শিক্ষা। কোনো বেঞ্চমার্ককেই চোখ বন্ধ করে বিশ্বাস করা উচিত নয়। সব সময় নিজের চোখে যাচাই করে নেওয়া ভালো।

আরও পড়ুন

🌐 তথ্যসূত্র ও স্বচ্ছতা

এই সংবাদটি আন্তর্জাতিক সূত্রের তথ্য অবলম্বনে AI-সহায়তায় বাংলায় উপস্থাপন ও বাংলাদেশের প্রেক্ষাপটে সম্পাদিত। মূল তথ্যের জন্য নিচের সূত্র দেখুন।

ট্যাগ:#রিসার্চ#AI#বাংলাদেশ#dev.to AI
AD
📧

AI নিউজ সরাসরি ইমেইলে পান

প্রতিদিনের সেরা AI খবর বাছাই করে আপনার inbox-এ পাঠাই। বিজ্ঞাপন নেই।

মূল প্রতিবেদন: dev.to AI

সোর্স দেখুন ↗

মন্তব্য

লোড হচ্ছে...