দীর্ঘ AI কনটেক্সটে মাঝের তথ্য ভুলে যায়, গবেষণায় চাঞ্চল্য
বড় ভাষার মডেল (LLM) দীর্ঘ কনটেক্সটের শুরু ও শেষের তথ্য ভালোভাবে মনে রাখে, কিন্তু মাঝের অংশের তথ্য প্রায়ই ভুলে যায়। Liu et al., 2023-এর এই গবেষণা দেখায়, বড় কনটেক্সট উইন্ডো থাকা সত্ত্বেও মডেলগুলোর মনোযোগ সমানভাবে বিতরণ হয় না।
বড় ভাষার মডেল (LLM) দীর্ঘ কনটেক্সটের শুরু ও শেষের তথ্য ভালোভাবে মনে রাখে, কিন্তু মাঝের অংশের তথ্য প্রায়ই ভুলে যায়। Liu et al., 2023-এর এই গবেষণা দেখায়, বড় কনটেক্সট উইন্ডো থাকা সত্ত্বেও মডেলগুলোর মনোযোগ সমানভাবে বিতরণ হয় না।
বড় ভাষার মডেল (LLM) যত বড় কনটেক্সট উইন্ডোই পাক না কেন, তারা দীর্ঘ নথির সব অংশ সমান গুরুত্ব দিয়ে পড়ে না। নতুন এক গবেষণায় দেখা গেছে, মডেলটি কনটেক্সটের শুরু ও শেষের তথ্য নির্ভুলভাবে মনে রাখলেও মাঝের অংশের তথ্য প্রায়ই হারিয়ে ফেলে। Liu et al., 2023-এর এই গবেষণাটি মেশিন লার্নিং ডেভেলপারদের মধ্যে আলোড়ন তুলেছে।
গবেষকরা একটি দীর্ঘ নথির ভেতরে একটি নির্দিষ্ট তথ্য (তথাকথিত 'নিডল') লুকিয়ে রেখে মডেলকে তা খুঁজে বের করতে বলেছেন। ফলাফলে দেখা গেছে, তথ্যটি যখন নথির শুরুতে বা একদম শেষে থাকে, তখন মডেলটি প্রায় শতভাগ নির্ভুলভাবে তা খুঁজে পায়। কিন্তু তথ্যটি যখন মাঝখানে থাকে, তখন সঠিকভাবে খুঁজে পাওয়ার সম্ভাবনা অনেক কমে যায়। এই প্রবণতাকে গ্রাফে আঁকলে একটি U-আকৃতির বক্ররেখা পাওয়া যায়, যার দুই প্রান্ত উঁচু এবং মাঝখান ঢালু।
এই ফলাফল প্রমাণ করে যে, বর্তমান LLM-গুলোর দীর্ঘ কনটেক্সট পরিচালনার সক্ষমতা নিয়ে আমাদের ধারণা ভুল। 100K টোকেনের কনটেক্সট উইন্ডো মানে এই নয় যে, মডেলটি 100K টোকেনের প্রতিটি শব্দ সমান মনোযোগ দিয়ে বিশ্লেষণ করছে। বরং এটি একটি সীমাবদ্ধতা, যা বাস্তব বিশ্বের অনেক কাজে প্রভাব ফেলতে পারে। যেমন, দীর্ঘ আইনি নথি বিশ্লেষণ, বৈজ্ঞানিক গবেষণাপত্র পর্যালোচনা, বা বহু পৃষ্ঠার রিপোর্ট থেকে তথ্য আহরণের ক্ষেত্রে মাঝের অংশের গুরুত্বপূর্ণ তথ্য হারিয়ে যাওয়ার আশঙ্কা থাকে।
গবেষণাটি ডেভেলপারদের জন্য একটি সতর্কবার্তা। যারা LLM ব্যবহার করে দীর্ঘ ডকুমেন্ট প্রসেসিং অ্যাপ্লিকেশন তৈরি করছেন, তাদের উচিত এই সীমাবদ্ধতা মাথায় রেখে ডিজাইন করা। তথ্য খোঁজার সময় শুধু কনটেক্সট উইন্ডোর আকারের উপর নির্ভর না করে, তথ্যের অবস্থানকে প্রাধান্য দেওয়া জরুরি। যেমন, গুরুত্বপূর্ণ তথ্য কনটেক্সটের শুরুতে বা শেষে রাখার কৌশল অবলম্বন করা যেতে পারে। অথবা, দীর্ঘ নথিকে ছোট ছোট ভাগে ভাগ করে প্রতিটি অংশ আলাদাভাবে বিশ্লেষণ করা যেতে পারে।
বাংলাদেশের ডেভেলপার এবং ফ্রিল্যান্সারদের জন্য এই গবেষণার তাৎপর্য অনেক। যারা লোকাল ভাষায় চ্যাটবট বা ডকুমেন্ট অ্যানালাইসিস টুল তৈরি করছেন, তারা যদি দীর্ঘ বাংলা কনটেক্সট নিয়ে কাজ করেন, তাহলে এই সমস্যা আরও প্রকট হতে পারে। কারণ বাংলা ভাষায় দীর্ঘ নথির মাঝখানের তথ্য খুঁজে পাওয়ার ক্ষেত্রে মডেলগুলোর পারফরম্যান্স আরও খারাপ হতে পারে। তাই অ্যাপ্লিকেশন ডিজাইনের সময় এই দিকটি বিবেচনায় রাখা জরুরি।
ভবিষ্যতে গবেষকরা এই সীমাবদ্ধতা কাটিয়ে উঠতে নতুন আর্কিটেকচার নিয়ে কাজ করছেন। যতদিন না পর্যন্ত মডেলগুলো সত্যিকার অর্থে দীর্ঘ কনটেক্সটের প্রতিটি অংশ সমান গুরুত্ব দিতে শেখে, ততদিন পর্যন্ত ডেভেলপারদের এই U-আকৃতির বক্ররেখাটি মনে রাখতে হবে। তথ্য যেখানে অবস্থান করছে, সেটিই হয়তো সবচেয়ে বড় চ্যালেঞ্জ।
আরও পড়ুন
এই সংবাদটি আন্তর্জাতিক সূত্রের তথ্য অবলম্বনে AI-সহায়তায় বাংলায় উপস্থাপন ও বাংলাদেশের প্রেক্ষাপটে সম্পাদিত। মূল তথ্যের জন্য নিচের সূত্র দেখুন।
মূল প্রতিবেদন: dev.to ML
সোর্স দেখুন ↗মন্তব্য০
লোড হচ্ছে...