DeepSeek V4-Flash-0731 প্রকাশ: খরচ ২০ গুণ কম, ফ্রিল্যান্সারদের জন্য বড় সুযোগ!
DeepSeek নীরবে V4-Flash-0731 মডেলটি MIT লাইসেন্সে প্রকাশ করেছে। 284B প্যারামিটারের এই MoE মডেলটি প্রতি টোকেনে মাত্র 12.8B প্যারামিটার সক্রিয় রাখে, যা খরচ ও গতিতে বড় সুবিধা দেয়।
DeepSeek নীরবে V4-Flash-0731 মডেলটি MIT লাইসেন্সে প্রকাশ করেছে। 284B প্যারামিটারের এই MoE মডেলটি প্রতি টোকেনে মাত্র 12.8B প্যারামিটার সক্রিয় রাখে, যা খরচ ও গতিতে বড় সুবিধা দেয়।
চীনের কৃত্রিম বুদ্ধিমত্তা গবেষণা প্রতিষ্ঠান DeepSeek 2026 সালের 31 জুলাই নীরবে তাদের নতুন মডেল V4-Flash-0731 প্রকাশ করেছে। 284 বিলিয়ন প্যারামিটারের এই মডেলটি Mixture-of-Experts বা MoE আর্কিটেকচারে নির্মিত, যেখানে প্রতি টোকেন প্রক্রিয়াকরণে মাত্র 12.8 বিলিয়ন প্যারামিটার সক্রিয় থাকে। অর্থাৎ মডেলটির মাত্র 4.5 শতাংশ ক্ষমতা প্রতিটি ধাপে ব্যবহৃত হয়, যা একে অত্যন্ত কার্যকরী ও সাশ্রয়ী করে তুলেছে।
সবচেয়ে উল্লেখযোগ্য বিষয় হলো, DeepSeek এই মডেলটি MIT লাইসেন্সের অধীনে প্রকাশ করেছে। ফলে গবেষক, ডেভেলপার এবং ব্যবসাপ্রতিষ্ঠানরা বাণিজ্যিক ও গবেষণা উভয় ক্ষেত্রেই এটি অবাধে ব্যবহার, পরিবর্তন এবং বিতরণ করতে পারবে। এটি ওপেন সোর্স AI কমিউনিটির জন্য একটি বড় সংবাদ, কারণ এত বড় মডেল সম্পূর্ণ ফ্রি লাইসেন্সে পাওয়া খুবই বিরল।
মডেলটির প্রকৃত কাঠামো বিশ্লেষণ করেছে VIDRAFT-এর Darwin নামক একটি মডেল-ইন্সপেকশন প্ল্যাটফর্ম। তারা মডেল কার্ডের ঘোষণা না পড়ে সরাসরি config.json ফাইল এবং প্রতিটি ওয়েট শার্ড পরীক্ষা করেছে, মোট 72,317 টেনসর মাপা হয়েছে। এই সরাসরি বিশ্লেষণ থেকে দেখা গেছে, মডেলটিতে 43টি MoE লেয়ার রয়েছে এবং প্রতিটি লেয়ারই MoE আর্কিটেকচারে নির্মিত। অর্থাৎ কোনো traditional dense লেয়ার নেই, যা একে সম্পূর্ণভাবে বিশেষায়িত একটি ডিজাইন।
এই হারনেস-অপটিমাইজড ডিজাইনটি বিশেষভাবে উল্লেখযোগ্য। সাধারণত MoE মডেলগুলিতে কিছু dense লেয়ার থাকে, কিন্তু V4-Flash-0731-এ সবগুলো লেয়ারই MoE, যা ইনফারেন্সের সময় কম্পিউটেশনাল খরচ আরও কমিয়ে আনে। 284B প্যারামিটারের পুরো মডেলটি মেমোরিতে রাখা প্রয়োজন, কিন্তু প্রতি টোকেনে শুধু 12.8B প্যারামিটার সক্রিয় থাকায় ইনফারেন্সের গতি অনেক বেশি এবং GPU মেমোরির প্রয়োজনীয়তা তুলনামূলকভাবে কম।
বাংলাদেশের ডেভেলপার, ফ্রিল্যান্সার এবং AI গবেষকদের জন্য এই মডেলটি একটি বড় সুযোগ। MIT লাইসেন্সের কারণে স্থানীয় স্টার্টআপ বা প্রতিষ্ঠানগুলো কোনো লাইসেন্স ফি ছাড়াই এই মডেলটি ব্যবহার করে নিজস্ব AI প্রোডাক্ট তৈরি করতে পারবে। বিশেষ করে যারা ইংরেজি ছাড়াও বাংলাসহ অন্যান্য ভাষায় কাজ করে, তারা এই মডেলটিকে ফাইন-টিউন করে লোকাল ল্যাঙ্গুয়েজ মডেল তৈরি করতে পারবে। তবে 284B প্যারামিটারের মডেলটি রান করতে হলে এখনও উচ্চক্ষমতাসম্পন্ন GPU-এর প্রয়োজন হবে, যা বাংলাদেশের সাধারণ ডেভেলপারদের জন্য একটি চ্যালেঞ্জ।
DeepSeek-এর এই পদক্ষেপ ওপেন সোর্স AI-এর জগতে একটি নতুন দৃষ্টান্ত স্থাপন করল। ভবিষ্যতে তারা আরও ছোট সক্রিয় প্যারামিটারসহ আরও কার্যকরী মডেল প্রকাশ করবে বলে আশা করা যায়। বাংলাদেশের AI কমিউনিটির জন্য এখন সময় এসেছে এই মডেলটি নিয়ে পরীক্ষা-নিরীক্ষা করার এবং নিজেদের প্রয়োজনে মানিয়ে নেওয়ার।
আরও পড়ুন
এই সংবাদটি আন্তর্জাতিক সূত্রের তথ্য অবলম্বনে AI-সহায়তায় বাংলায় উপস্থাপন ও বাংলাদেশের প্রেক্ষাপটে সম্পাদিত। মূল তথ্যের জন্য নিচের সূত্র দেখুন।
মূল প্রতিবেদন: dev.to ML
সোর্স দেখুন ↗মন্তব্য০
লোড হচ্ছে...