گروهی از دانشمندان MIT موفق به توسعه یک شبکه عصبی پیشرفته به نام Speech2Face شدهاند که قادر است تنها با شنیدن صدای یک فرد، ویژگیهای چهره او را حدس بزند. این فناوری به گونهای طراحی شده است که ارتباطات آماری میان ویژگیهای چهره و صداهای گویندگان را شناسایی کند.
در حالی که فناوریهای مشابهی وجود دارند که میتوانند چهره افراد را با تحلیل ویژگیهای صورت شناسایی کنند، Speech2Face به دنبال راهی است که تنها از طریق صدا، تصویر چهره فرد را بازسازی کند. این مدل هنوز به دقت کامل نرسیده است، اما توانسته است جزئیات قابل توجهی را به درستی شناسایی کند.
توسعهدهندگان این فناوری میگویند: “مدل ما برای نشان دادن ارتباطات آماری موجود بین ویژگیهای چهره و صداهای گویندگان در دادههای آموزشی طراحی شده است.” دادههای آموزشی این مدل شامل مجموعهای از ویدیوهای آموزشی از یوتیوب است که به طور مساوی نماینده جمعیت جهانی نیست. بنابراین، این مدل تحت تأثیر توزیع نابرابر دادهها قرار دارد.


چگونه Speech2Face کار میکند؟
با استفاده از این فناوری، میتوان به راحتی از روی صدا، جنسیت، سن و حتی برخی ویژگیهای ظاهری مانند شکل بینی و استخوانهای گونه را تشخیص داد. به عنوان مثال، Speech2Face میتواند به دقت شکل بینی، استخوانهای گونه یا فک را تنها از طریق صدا شناسایی کند، زیرا ساختار بینی و سایر استخوانهای صورت بر نحوه صدا تأثیر میگذارد.
این فناوری همچنین قادر است ویژگیهای قومی را تنها با شنیدن چند میلیثانیه از صدا تشخیص دهد. اما این مدل هنوز در برخی موارد با چالشهایی مواجه است. عواملی مانند لهجه، زبان گفتاری و تن صدا میتوانند باعث ایجاد ناهماهنگیهای بزرگ در شناسایی ویژگیهای ظاهری شوند. برای مثال، مردانی با صدای بلند ممکن است به عنوان زن شناسایی شوند و بالعکس.

چالشها و آینده فناوری
با وجود محدودیتهای موجود، Speech2Face نمایی از آینده فناوری هوش مصنوعی را ارائه میدهد که همزمان میتواند ترسناک و شگفتانگیز باشد. تصور کنید که تنها با چند میلیثانیه از صدا، یک شبکه عصبی بتواند پرتره دقیقی از فرد بسازد. این فناوری میتواند در شناسایی مجرمان کمک کند، اما سوال اینجاست که چه چیزی مانع از سوءاستفاده از این فناوری برای مقاصد نادرست خواهد بود؟
اگر این روایت برایتان جالب بود، کشف بعدی را از پیشنهادهای پایین انتخاب کنید.