মুখের কথা বার্তায় রূপান্তরের জন্য নতুন ট্রান্সক্রাইব মডেল আনল মেটা
ব্যবহারকারীদের মুখের কথা সঙ্গে সঙ্গে লেখায় রূপান্তর করতে সক্ষম কৃত্রিম বুদ্ধিমত্তানির্ভর (এআই) ‘মিউজ ভয়েস ট্রান্সক্রাইব’ মডেল উন্মোচন করেছে মেটা। প্রতিষ্ঠানটির দাবি, ৭০টির বেশি ভাষার অডিও ব্যবহার করে মিউজ ভয়েস ট্রান্সক্রাইবকে প্রশিক্ষণ দেওয়া হলেও প্রাথমিকভাবে ২৫টি ভাষায় বলা কথা তাৎক্ষণিকভাবে লেখায় রূপান্তর করে দেবে মডেলটি। এক ঘণ্টার বেশি সময়ের অডিও শুনে বার্তা লিখতে সক্ষম মডেলটি ভাষা পরিবর্তন করে কথা বললেও শনাক্ত করতে পারে। মেটার তৈরি প্রথম রিয়েল টাইম অডিও বিশ্লেষণ মডেলটি প্রাথমিকভাবে এআই ফর ম্যাক, মিউজ কোড এবং ডেভেলপারদের জন্য তৈরি মেটা মডেল এপিআইয়ে ব্যবহার করা যাবে।
মেটার সুপারইন্টেলিজেন্স ল্যাবস জানিয়েছে, মিউজ ভয়েস ট্রান্সক্রাইব মডেলটি কথা বলার সময়ই অডিওকে লেখায় রূপান্তর করতে পারে। একই সঙ্গে এটি একাধিক বক্তার কণ্ঠ শনাক্তের পাশাপাশি কেউ কথা বলা শেষ করেছেন কি না, সেটিও বুঝতে পারে। একসঙ্গে ২০ জন বক্তার কণ্ঠ শনাক্ত করতে পারায় যেকোনো বৈঠকের অডিও শুনে বক্তাদের বলা কথাগুলো আলাদাভাবে লিখতে পারে মডেলটি। ফলে অডিও ধারণের পর আলাদাভাবে তা প্রক্রিয়াজাত করার প্রয়োজন হয় না।