কল সেন্টারে বিপ্লব: কাস্টমারের কণ্ঠ শুনেই উত্তর দেবে নতুন AI
PolyAI নতুন অডিও-নেটিভ ডায়ালগ মডেল Dialog-RSN-1 প্রকাশ করেছে, যা কলারের অডিও সরাসরি প্রসেস করে ASR ট্রান্সক্রিপ্টের প্রয়োজন হয় না। এই মডেলটি টার্ন-টেকিং, স্পিচ রিকগনিশন, ফাংশন কলিং এবং রেসপন্স জেনারেশন একীভূত করেছে, ফলে লাইভ ডিপ্লয়মেন্টে 300 মিলিসেকেন্ডের কম সময়ে উত্তর দিতে পারে।
PolyAI নতুন অডিও-নেটিভ ডায়ালগ মডেল Dialog-RSN-1 প্রকাশ করেছে, যা কলারের অডিও সরাসরি প্রসেস করে ASR ট্রান্সক্রিপ্টের প্রয়োজন হয় না। এই মডেলটি টার্ন-টেকিং, স্পিচ রিকগনিশন, ফাংশন কলিং এবং রেসপন্স জেনারেশন একীভূত করেছে, ফলে লাইভ ডিপ্লয়মেন্টে 300 মিলিসেকেন্ডের কম সময়ে উত্তর দিতে পারে।
PolyAI ঘোষণা করেছে যে তারা তাদের নতুন অডিও-নেটিভ ডায়ালগ মডেল Dialog-RSN-1 প্রকাশ করেছে। এই মডেলটি কলারের অডিও সরাসরি প্রসেস করে, ফলে আগের মতো ASR ট্রান্সক্রিপ্ট পড়ার প্রয়োজন হয় না। এটি টার্ন-টেকিং, স্পিচ রিকগনিশন, ফাংশন কলিং এবং রেসপন্স জেনারেশন একীভূত করেছে, যা কল সেন্টার ও ভয়েস অ্যাসিস্ট্যান্টের জন্য বড় পরিবর্তন আনতে পারে।
এই মডেলটির সবচেয়ে বড় বৈশিষ্ট্য হলো এটি একটি একক অডিও-নেটিভ মডেল হিসেবে কাজ করে। TTS (টেক্সট-টু-স্পিচ) আলাদা রাখা হয়েছে, যাতে আউটপুট ভয়েস নিয়ন্ত্রণযোগ্য থাকে। অর্থাৎ, মডেলটি যা বলবে তা নির্ধারণ করে, কিন্তু ভয়েসটি কেমন হবে তা ব্যবহারকারী বা ডেভেলপার নিয়ন্ত্রণ করতে পারবে।
Dialog-RSN-1 একটি রিকোয়েস্ট-বেসড LLM (লার্জ ল্যাঙ্গুয়েজ মডেল) হিসেবে চলে, মানে এটি সর্বদা স্ট্রিমিং চালু রাখে না। এই ডিজাইনটি লেটেন্সি কমাতে সাহায্য করে। PolyAI জানিয়েছে, লাইভ ডিপ্লয়মেন্টে এই মডেলটি 300 মিলিসেকেন্ডের কম সময়ে রেসপন্স দিতে পারে। আগের মডেলগুলোর তুলনায় এটি প্রায় ৩ গুণ দ্রুত, যা ব্যবহারকারীর অভিজ্ঞতা অনেক উন্নত করবে।
এই মডেলটি কল সেন্টারের অটোমেশনে বড় প্রভাব ফেলতে পারে। সাধারণত কল সেন্টারে ASR ট্রান্সক্রিপ্ট ব্যবহার করে বট কথা বলে, কিন্তু এই পদ্ধতিতে ভুল হওয়ার সম্ভাবনা থাকে। Dialog-RSN-1 সরাসরি অডিও প্রসেস করে, তাই এটি আরও নির্ভুল এবং প্রাকৃতিক সংলাপ তৈরি করতে পারে। ফাংশন কলিং সুবিধা থাকায় এটি API কল করতে পারে, যেমন ব্যালেন্স চেক করা বা অর্ডার স্ট্যাটাস দেখানো, সবকিছু একই মডেলের মাধ্যমে।
বাংলাদেশের ডেভেলপার এবং ব্যবসার জন্য এই খবর গুরুত্বপূর্ণ। যেসব কোম্পানি কল সেন্টার বা ভয়েস-ভিত্তিক সেবা দিচ্ছে, তারা Dialog-RSN-1 ব্যবহার করে গ্রাহক সেবা অটোমেট করতে পারে। বিশেষ করে যারা ইংরেজি বা বাংলা দুই ভাষাতেই কাজ করে, তাদের জন্য অডিও-নেটিভ মডেলটি সহায়ক হবে, কারণ এটি ট্রান্সক্রিপ্টের ওপর নির্ভর করে না। ফ্রিল্যান্সার এবং স্টার্টআপরা এই মডেলটি ব্যবহার করে দ্রুত ভয়েস অ্যাসিস্ট্যান্ট তৈরি করতে পারবে, যা আগের চেয়ে কম কোডে কাজ করবে।
তবে এই মডেলটি এখনো নতুন, তাই এর সীমাবদ্ধতাও আছে। PolyAI এখনো মডেলটির সব বিস্তারিত প্রকাশ করেনি, যেমন প্রশিক্ষণ ডেটা বা ভাষা সমর্থন। তবুও, এই দিকটি ভয়েস AI-এর ভবিষ্যৎ নির্দেশ করছে, যেখানে ট্রান্সক্রিপ্টের পরিবর্তে সরাসরি অডিও প্রসেসিং হবে। বাংলাদেশের ডেভেলপারদের জন্য এটা নতুন সুযোগ তৈরি করবে, বিশেষ করে স্থানীয় ভাষার ভয়েস অ্যাপ্লিকেশনে।
আরও পড়ুন
এই সংবাদটি আন্তর্জাতিক সূত্রের তথ্য অবলম্বনে AI-সহায়তায় বাংলায় উপস্থাপন ও বাংলাদেশের প্রেক্ষাপটে সম্পাদিত। মূল তথ্যের জন্য নিচের সূত্র দেখুন।
মূল প্রতিবেদন: MarkTechPost
সোর্স দেখুন ↗মন্তব্য০
লোড হচ্ছে...