از چند میکروفون تا هوش مصنوعی؛ گوشی چگونه صدای شما را از نویز جدا می‌کند؟

گوشی‌های هوشمند امروزی برای دریافت صدا دیگر به یک میکروفون ساده متکی نیستند. بیشتر تلفن‌ها چند میکروفون دارند که در بخش‌های مختلف بدنه قرار گرفته‌اند و هرکدام صدای محیط را از موقعیتی اندکی متفاوت دریافت می‌کنند.

همین تفاوت کوچک، اطلاعات ارزشمندی در اختیار سیستم صوتی گوشی قرار می‌دهد. وقتی فردی صحبت می‌کند، صدای او با اختلاف زمانی و شدت متفاوت به میکروفون‌های مختلف می‌رسد. پردازنده گوشی می‌تواند از این اختلاف‌ها برای تخمین جهت منبع صدا استفاده کند و تشخیص دهد کدام سیگنال احتمالاً مربوط به گوینده اصلی است.

 

چند میکروفون چگونه به حذف صداهای مزاحم کمک می‌کنند؟




تصور کنید در خیابان مشغول صحبت با تلفن هستید. صدای شما از یک جهت به گوشی می‌رسد، در حالی که صدای خودروها، افراد دیگر و سایر منابع صوتی از جهات مختلف وارد می‌شوند.

گوشی می‌تواند اطلاعات دریافت‌شده توسط میکروفون‌های مختلف را با یکدیگر مقایسه کند. این کار امکان تقویت سیگنالی را که از جهت مورد نظر می‌آید و کاهش سیگنال‌هایی را که از جهات دیگر وارد شده‌اند، فراهم می‌کند.

یکی از فناوری‌های مهم در این مرحله Beamforming یا شکل‌دهی پرتو است. در این روش، سیستم با استفاده از آرایه‌ای از میکروفون‌ها تمرکز خود را به سمت یک منبع صوتی مشخص هدایت می‌کند. در نتیجه، صدای فرد مورد نظر نسبت به بخشی از نویزهای اطراف برجسته‌تر می‌شود.

البته Beamforming به‌تنهایی نمی‌تواند تمام صداهای مزاحم را حذف کند. به همین دلیل، پس از دریافت صدا مرحله دیگری از پردازش آغاز می‌شود.

 

پردازش دیجیتال وارد عمل می‌شود




سیگنال خامی که میکروفون دریافت می‌کند ترکیبی از صدای گوینده و صداهای مختلف محیط است. پردازشگر صوتی گوشی این سیگنال را بررسی می‌کند تا بتواند نویزهای ناخواسته را کاهش دهد.

برخی صداها نسبتاً ساده‌تر قابل شناسایی هستند. برای مثال، صدای یکنواخت کولر، موتور خودرو یا صدای پس‌زمینه ثابت را می‌توان با روش‌های پردازش سیگنال تا حد زیادی کاهش داد.

اما مشکل زمانی پیچیده‌تر می‌شود که نویز محیط شبیه گفتار انسان باشد؛ برای مثال، زمانی که چند نفر هم‌زمان صحبت می‌کنند. در چنین شرایطی، سیستم باید علاوه بر شدت و جهت صدا، ویژگی‌های پیچیده‌تر صوتی را نیز بررسی کند.

 


 

هوش مصنوعی به کمک گوشی می‌آید




در گوشی‌های جدید، یادگیری ماشین نیز نقش مهمی در پردازش صوت دارد. مدل‌های صوتی می‌توانند با استفاده از نمونه‌های بسیار زیادی از گفتار و نویز آموزش ببینند تا تفاوت میان صدای انسان و صداهای مزاحم را بهتر تشخیص دهند.

این مدل‌ها می‌توانند به سیستم کمک کنند بخش‌هایی از سیگنال را که احتمالاً حاوی گفتار هستند، شناسایی کند و نویز موجود در آنها را کاهش دهد. در برخی فناوری‌های پیشرفته‌تر، مدل‌های عصبی حتی می‌توانند تلاش کنند گفتار یک فرد را از میان صدای چند گوینده یا محیط‌های بسیار شلوغ استخراج کنند.

هدف این مرحله الزاماً تولید صدایی نیست که برای گوش انسان کاملاً طبیعی به نظر برسد؛ بلکه در بسیاری از کاربردها هدف اصلی، تولید سیگنالی است که سیستم تشخیص گفتار بتواند آن را بهتر درک کند.

 

آیا گوشی صدای شما را می‌شناسد؟




در اینجا باید میان دو مفهوم متفاوت تمایز قائل شد: جداسازی صدای گوینده و تشخیص هویت گوینده.

وقتی گوشی تلاش می‌کند صدای شما را از صدای خودروها یا افراد اطراف جدا کند، لزوماً نمی‌داند شما چه کسی هستید. در این مرحله فقط تلاش می‌کند گفتار مورد نظر را از سایر صداها استخراج کند.

اما برخی قابلیت‌ها می‌توانند از ویژگی‌های منحصربه‌فرد صدا برای تشخیص یا تأیید هویت گوینده استفاده کنند. این قابلیت به نوع سیستم و کاربرد آن بستگی دارد.

بنابراین، وقتی دستیار صوتی گوشی در یک محیط شلوغ فرمان شما را درست متوجه می‌شود، این موضوع الزاماً به معنای آن نیست که گوشی هویت شما را تشخیص داده است؛ ممکن است فقط توانسته باشد گفتار شما را با موفقیت از نویز جدا کند.

 

از ارتعاش هوا تا تبدیل شدن به متن




پس از پردازش و پاک‌سازی نسبی سیگنال، مرحله تشخیص گفتار خودکار آغاز می‌شود. در این مرحله، سیستم صوتی تلاش می‌کند الگوی موجود در موج صوتی را به واحدهای زبانی و سپس کلمات تبدیل کند.

برای مثال، هنگامی که یک پیام را به‌صورت صوتی دیکته می‌کنید، مسیر کلی چنین است: میکروفون صدا را دریافت می‌کند، پردازش صوتی نویز را کاهش می‌دهد، الگوریتم‌های مربوط به گفتار سیگنال را تحلیل می‌کنند و در نهایت سامانه تشخیص گفتار آن را به متن تبدیل می‌کند.

تمام این مراحل در کسری از ثانیه انجام می‌شوند و به همین دلیل کاربر معمولاً متوجه زنجیره پیچیده پردازش‌هایی که میان گفتن یک جمله و ظاهر شدن آن روی صفحه رخ می‌دهد، نمی‌شود.

 

گوشی در واقع یک «گوش» واحد نیست




در نتیجه، توانایی گوشی‌های هوشمند برای شنیدن صدای کاربر در محیط‌های شلوغ حاصل یک فناوری واحد نیست. چند میکروفون، آرایه‌های صوتی، پردازش سیگنال دیجیتال، Beamforming، الگوریتم‌های حذف نویز و مدل‌های یادگیری ماشین همگی در کنار یکدیگر کار می‌کنند.

همین ترکیب باعث می‌شود تلفن بتواند از میان صدای خودروها، موسیقی، گفت‌وگوی افراد و سایر صداهای محیط، سیگنالی را که بیشترین احتمال را برای حاوی بودن گفتار کاربر دارد استخراج کند و سپس آن را در اختیار سیستم تشخیص گفتار قرار دهد.

البته عملکرد این فناوری‌ها بی‌نقص نیست و محیط‌های بسیار شلوغ، چند گوینده هم‌زمان، فاصله زیاد از گوشی یا صداهای ناگهانی همچنان می‌توانند دقت سیستم را کاهش دهند. با این حال، پیشرفت پردازش صوت و مدل‌های هوش مصنوعی باعث شده گوشی‌های امروزی در شرایطی که برای یک میکروفون معمولی بسیار دشوار است، گفتار انسان را با دقت قابل توجهی تشخیص دهند.

مشاهده بیشتر

نوشته های مشابه

دکمه بازگشت به بالا