LIVE
টুলAI এজেন্টদের জন্য উন্মুক্ত DocuBrowser, ক্লাউড ছাড়াই ফাইলকে জ্ঞানভাণ্ডারে পরিণত করেটুল৫০% কম খরচে স্পিকার চেনার ওপেনসোর্স টুল, ফ্রিল্যান্সারদের জন্য বড় সুযোগগবেষণাAI এজেন্টের আসল বুদ্ধি লুকিয়ে তার সিদ্ধান্ত প্রক্রিয়ায়, জানুন কী লাভ হবেটুলভাইব চেক নয়, মেট্রিক দিয়ে এলএলএম পরীক্ষা করুন, ৯২% হ্যালুসিনেশন ধরা সম্ভবটুলবাংলাদেশি সাইবার বিশেষজ্ঞদের জন্য সুখবর: ওপেন সোর্স ল্যাবে হাতে-কলমে AI নিরাপত্তা শেখা যাবেইন্ডাস্ট্রিNovita ও StreamLake LLM মূল্য কমল, ডেভেলপারদের খরচ বাঁচবে কতমডেলআলিবাবার Qwen 3.8 এআই মডেলে ফ্রিল্যান্সারদের কাজ ৩ গুণ বাড়ার সম্ভাবনাইন্ডাস্ট্রিনিউইয়র্কে বায়োমেট্রিক স্ক্যানিংয়ের তথ্য জানানো বাধ্যতামূলক, ডেভেলপারদের জন্য বড় পরিবর্তনগবেষণাAI গবেষণায় বাংলাদেশের ফ্রিল্যান্সারদের জন্য নতুন দিগন্ত, জানুন কীভাবেটুলAI মডেলের ভুল ৯২% শনাক্ত করছে নতুন পদ্ধতি, জানুন আপনার কাজে কী লাভইন্ডাস্ট্রিNovita ও StreamLake-এ LLM খরচ বাড়ছে, ডেভেলপারদের প্রস্তুতি নিনটুলRailward ওপেন সোর্স টুল: নিজেই নিজেকে আক্রমণ করে AI এজেন্টের নিরাপত্তা নিশ্চিত করবেটুলAI এজেন্টদের জন্য উন্মুক্ত DocuBrowser, ক্লাউড ছাড়াই ফাইলকে জ্ঞানভাণ্ডারে পরিণত করেটুল৫০% কম খরচে স্পিকার চেনার ওপেনসোর্স টুল, ফ্রিল্যান্সারদের জন্য বড় সুযোগগবেষণাAI এজেন্টের আসল বুদ্ধি লুকিয়ে তার সিদ্ধান্ত প্রক্রিয়ায়, জানুন কী লাভ হবেটুলভাইব চেক নয়, মেট্রিক দিয়ে এলএলএম পরীক্ষা করুন, ৯২% হ্যালুসিনেশন ধরা সম্ভবটুলবাংলাদেশি সাইবার বিশেষজ্ঞদের জন্য সুখবর: ওপেন সোর্স ল্যাবে হাতে-কলমে AI নিরাপত্তা শেখা যাবেইন্ডাস্ট্রিNovita ও StreamLake LLM মূল্য কমল, ডেভেলপারদের খরচ বাঁচবে কতমডেলআলিবাবার Qwen 3.8 এআই মডেলে ফ্রিল্যান্সারদের কাজ ৩ গুণ বাড়ার সম্ভাবনাইন্ডাস্ট্রিনিউইয়র্কে বায়োমেট্রিক স্ক্যানিংয়ের তথ্য জানানো বাধ্যতামূলক, ডেভেলপারদের জন্য বড় পরিবর্তনগবেষণাAI গবেষণায় বাংলাদেশের ফ্রিল্যান্সারদের জন্য নতুন দিগন্ত, জানুন কীভাবেটুলAI মডেলের ভুল ৯২% শনাক্ত করছে নতুন পদ্ধতি, জানুন আপনার কাজে কী লাভইন্ডাস্ট্রিNovita ও StreamLake-এ LLM খরচ বাড়ছে, ডেভেলপারদের প্রস্তুতি নিনটুলRailward ওপেন সোর্স টুল: নিজেই নিজেকে আক্রমণ করে AI এজেন্টের নিরাপত্তা নিশ্চিত করবে
হোম/নিউজ/রিসার্চ
রিসার্চ৫ মিনিট পড়া

বাংলাদেশে PII সুরক্ষায় নতুন দিগন্ত: Ensemble পদ্ধতি Regex-কে ৪ গুণে হারাল

একটি নতুন গবেষণায় PII শনাক্তকরণের তিনটি পদ্ধতি তুলনা করে দেখা গেছে, Ensemble পদ্ধতি সর্বোচ্চ গড় F1 স্কোর 0.662 অর্জন করেছে। অন্যদিকে, মেডিকেল টেক্সটে BERT-NER-এর F1 স্কোর মাত্র 0.167, যা Regex-এর চেয়েও দুর্বল।

d
সম্পাদকীয় টিম
স্টাফ রিপোর্টার · ৪৫ দিন আগে · সূত্র: dev.to ML
বাংলাদেশে PII সুরক্ষায় নতুন দিগন্ত: Ensemble পদ্ধতি Regex-কে ৪ গুণে হারাল

একটি নতুন গবেষণায় PII শনাক্তকরণের তিনটি পদ্ধতি তুলনা করে দেখা গেছে, Ensemble পদ্ধতি সর্বোচ্চ গড় F1 স্কোর 0.662 অর্জন করেছে। অন্যদিকে, মেডিকেল টেক্সটে BERT-NER-এর F1 স্কোর মাত্র 0.167, যা Regex-এর চেয়েও দুর্বল।

প্রযুক্তি সংবাদমাধ্যম dev.to-তে প্রকাশিত একটি সাম্প্রতিক গবেষণায় ব্যক্তিগত শনাক্তকারী তথ্য (PII) শনাক্তকরণের তিনটি ভিন্ন পদ্ধতির তুলনামূলক পরীক্ষা করা হয়েছে। গবেষণাটি 2026 সালের এপ্রিল মাসের শেষের দিকে পরিচালিত হয় এবং এতে মোট 9টি ভিন্ন পরিস্থিতিতে পরীক্ষা চালানো হয়। পরিস্থিতিগুলোর মধ্যে ছিল বাণিজ্যিক চুক্তি, মানবসম্পদ রেকর্ড, কোড রিভিউ, ইলেকট্রনিক মেডিকেল রেকর্ডের সারাংশ, জিন রিপোর্ট এবং রেডিওলজি রিপোর্ট। এর পাশাপাশি তিন ধরনের অস্পষ্ট বা গোপন করা PII ফরম্যাটও পরীক্ষায় অন্তর্ভুক্ত ছিল।

গবেষণার মূল ফলাফল অনুযায়ী, Ensemble পদ্ধতি সর্বোচ্চ গড় F1 স্কোর 0.662 অর্জন করেছে। F1 স্কোর হলো একটি মেট্রিক যা নির্ভুলতা এবং পুনরুদ্ধারের মধ্যে ভারসাম্য পরিমাপ করে। অন্যদিকে, শুধুমাত্র BERT-NER মডেল ব্যবহার করে চালানো পরীক্ষায় গড় F1 স্কোর ছিল মাত্র 0.167। বিশেষ করে মেডিকেল টেক্সটের ক্ষেত্রে BERT-NER-এর পারফরম্যান্স ছিল অত্যন্ত দুর্বল।

তিনটি পদ্ধতির ডিজাইন লজিক ভিন্ন ছিল। প্রথম পদ্ধতি Regex সম্পূর্ণ নিয়মভিত্তিক। এটি নির্দিষ্ট ফরম্যাট যেমন ফোন নম্বর, ইমেইল, আইডি কার্ড নম্বর এবং তারিখ শনাক্ত করতে পারে। এই পদ্ধতির বিলম্ব প্রায় শূন্য, প্রতি রেকর্ডে 0.3 মিলিসেকেন্ডের কম সময় লাগে। দ্বিতীয় পদ্ধতি BERT-NER একটি প্রাক-প্রশিক্ষিত ভাষা মডেল ব্যবহার করে যা প্রসঙ্গ বুঝে PII শনাক্ত করার চেষ্টা করে। তবে মেডিকেল টেক্সটের জটিলতার কারণে এটি ভালো কাজ করতে পারেনি। তৃতীয় পদ্ধতি Ensemble উভয় পদ্ধতির শক্তিকে একত্রিত করে, যা সবচেয়ে ভালো ফলাফল দিয়েছে।

বাংলাদেশের জন্য এই গবেষণার গুরুত্ব অনেক। বর্তমানে বাংলাদেশে হেলথটেক এবং ফিনটেক সেক্টর দ্রুত প্রসারিত হচ্ছে। অনেক স্টার্টআপ মেডিকেল রেকর্ড এবং আর্থিক তথ্য প্রক্রিয়াকরণের জন্য AI পাইপলাইন তৈরি করছে। এই গবেষণার ফলাফল তাদের জন্য একটি গুরুত্বপূর্ণ নির্দেশনা হতে পারে। বিশেষ করে যারা মেডিকেল ডেটা নিয়ে কাজ করছেন, তাদের জন্য BERT-NER-এর দুর্বলতা একটি বড় সতর্কবার্তা।

গবেষণাটি আরও দেখিয়েছে যে শুধুমাত্র একটি পদ্ধতির ওপর নির্ভর না করে একাধিক পদ্ধতির সমন্বয় ব্যবহার করলে PII শনাক্তকরণের নির্ভুলতা অনেক বাড়ানো সম্ভব। Ensemble পদ্ধতি Regex-এর দ্রুততা এবং BERT-NER-এর প্রসঙ্গ বোঝার ক্ষমতাকে একত্রিত করে কাজ করে। এই পদ্ধতি বর্তমানে মেডিকেল AI পাইপলাইনের জন্য সবচেয়ে কার্যকর সমাধান হিসেবে দেখা হচ্ছে।

ভবিষ্যতে আরও উন্নত মডেল এবং ডেটা সেট ব্যবহার করে এই ধরনের গবেষণা অব্যাহত থাকবে। বাংলাদেশের ডেভেলপার এবং গবেষকদের জন্য এটি একটি সময়োপযোগী নির্দেশনা। তাদের উচিত তাদের নিজস্ব পাইপলাইনে Ensemble পদ্ধতি প্রয়োগ করে PII শনাক্তকরণের নির্ভুলতা বাড়ানো।

আরও পড়ুন

🌐 তথ্যসূত্র ও স্বচ্ছতা

এই সংবাদটি আন্তর্জাতিক সূত্রের তথ্য অবলম্বনে AI-সহায়তায় বাংলায় উপস্থাপন ও বাংলাদেশের প্রেক্ষাপটে সম্পাদিত। মূল তথ্যের জন্য নিচের সূত্র দেখুন।

ট্যাগ:#রিসার্চ#AI#বাংলাদেশ#dev.to ML
AD
📧

AI নিউজ সরাসরি ইমেইলে পান

প্রতিদিনের সেরা AI খবর বাছাই করে আপনার inbox-এ পাঠাই। বিজ্ঞাপন নেই।

মূল প্রতিবেদন: dev.to ML

সোর্স দেখুন ↗

মন্তব্য

লোড হচ্ছে...