AMD-র নতুন ওপেন AI মডেলে ফ্রিল্যান্সাররা পাবেন বিনামূল্যে শক্তিশালী টুল
AMD Instella-MoE-16B-A3B প্রকাশ করেছে, একটি সম্পূর্ণ ওপেন মিশ্রণ-অফ-এক্সপার্টস (MoE) ভাষা মডেল। মডেলটিতে মোট 16B প্যারামিটার থাকলেও প্রতি টোকেনে মাত্র 2.8B সক্রিয় হয়। এটি AMD-র Instinct GPU-তে স্ক্র্যাচ থেকে প্রশিক্ষিত এবং সমস্ত প্রশিক্ষণ পর্যায়ের ওজন প্রকাশ করেছে।
AMD Instella-MoE-16B-A3B প্রকাশ করেছে, একটি সম্পূর্ণ ওপেন মিশ্রণ-অফ-এক্সপার্টস (MoE) ভাষা মডেল। মডেলটিতে মোট 16B প্যারামিটার থাকলেও প্রতি টোকেনে মাত্র 2.8B সক্রিয় হয়। এটি AMD-র Instinct GPU-তে স্ক্র্যাচ থেকে প্রশিক্ষিত এবং সমস্ত প্রশিক্ষণ পর্যায়ের ওজন প্রকাশ করেছে।
প্রযুক্তি জায়ান্ট AMD তাদের নতুন ওপেন সোর্স ভাষা মডেল Instella-MoE-16B-A3B প্রকাশ করেছে। এটি একটি মিশ্রণ-অফ-এক্সপার্টস (Mixture-of-Experts) আর্কিটেকচার, যেখানে মোট 16 বিলিয়ন প্যারামিটার থাকলেও প্রতি টোকেনে মাত্র 2.8 বিলিয়ন প্যারামিটার সক্রিয় হয়। এই মডেলটি AMD-র নিজস্ব Instinct MI300X এবং MI325X GPU-তে স্ক্র্যাচ থেকে প্রশিক্ষিত, যা কোম্পানির হার্ডওয়্যার সক্ষমতার একটি বড় প্রমাণ।
এই প্রকাশের সবচেয়ে উল্লেখযোগ্য দিক হলো সম্পূর্ণ উন্মুক্ততা। AMD শুধু চূড়ান্ত মডেলের ওজনই প্রকাশ করেনি, বরং প্রশিক্ষণের প্রতিটি ধাপের ওজন, ডেটা মিশ্রণ, কনফিগারেশন এবং ইনফারেন্স কোডও প্রকাশ করেছে। এটি গবেষক এবং ডেভেলপারদের জন্য একটি যুগান্তকারী পদক্ষেপ, কারণ তারা এখন মডেলটির অভ্যন্তরীণ প্রক্রিয়া সম্পূর্ণভাবে বুঝতে এবং পরীক্ষা করতে পারবে।
প্রযুক্তিগত দিক থেকে, Instella-MoE-16B-A3B দুটি উন্নত কৌশল ব্যবহার করেছে। প্রথমটি হলো Gated Multi-head Latent Attention (Gated MLA), যা কার্যকরভাবে তথ্য প্রক্রিয়াকরণের সময় কম্পিউটেশনাল খরচ কমায়। দ্বিতীয়টি হলো FarSkip-Collective, যা একাধিক GPU-এর মধ্যে যোগাযোগ দ্রুত করে প্রশিক্ষণের গতি বাড়ায়। এই দুটি কৌশলই মডেলটিকে একই আকারের অন্যান্য মডেলের তুলনায় দ্রুত এবং দক্ষ করে তুলেছে।
বাংলাদেশের ডেভেলপার, গবেষক এবং AI উদ্যোক্তাদের জন্য এই খবর অত্যন্ত গুরুত্বপূর্ণ। যেহেতু মডেলটি সম্পূর্ণ ওপেন, তাই স্থানীয় ডেভেলপাররা এটি নিজস্ব সার্ভারে বা ক্লাউডে স্থাপন করে বাংলা ভাষার প্রসেসিং, টেক্সট জেনারেশন, বা অন্যান্য NLP কাজে ব্যবহার করতে পারবে। তাছাড়া, AMD-র Instinct GPU-তে প্রশিক্ষিত এই মডেলটি দেখায় যে উচ্চক্ষমতাসম্পন্ন AI মডেল তৈরি করতে শুধু NVIDIA-র উপর নির্ভর করতে হয় না। এটি বাংলাদেশের শিক্ষার্থী এবং গবেষকদের জন্য একটি উন্মুক্ত প্ল্যাটফর্ম, যেখানে তারা বাস্তব অভিজ্ঞতা অর্জন করতে পারবে।
তবে একটি বিষয় মনে রাখা দরকার, মডেলটি চালানোর জন্য উচ্চক্ষমতাসম্পন্ন GPU প্রয়োজন, যা বাংলাদেশের সাধারণ ব্যবহারকারীদের জন্য সহজলভ্য নয়। কিন্তু ক্লাউড পরিষেবা বা গবেষণা প্রতিষ্ঠানের মাধ্যমে এটি ব্যবহার করা যেতে পারে। MarkTechPost-এর প্রতিবেদন অনুযায়ী, AMD এই মডেলটি প্রকাশ করে ওপেন AI ইকোসিস্টেমে একটি নতুন মানদণ্ড স্থাপন করেছে।
ভবিষ্যতে AMD-র এই উদ্যোগ আরও বেশি ওপেন মডেল প্রকাশের পথ সুগম করবে বলে আশা করা যায়। যারা AI মডেল নিয়ে কাজ করতে চান, তাদের জন্য এটি একটি মূল্যবান সম্পদ।
আরও পড়ুন
এই সংবাদটি আন্তর্জাতিক সূত্রের তথ্য অবলম্বনে AI-সহায়তায় বাংলায় উপস্থাপন ও বাংলাদেশের প্রেক্ষাপটে সম্পাদিত। মূল তথ্যের জন্য নিচের সূত্র দেখুন।
মূল প্রতিবেদন: MarkTechPost
সোর্স দেখুন ↗মন্তব্য০
লোড হচ্ছে...