از چند میکروفون تا هوش مصنوعی؛ گوشی چگونه صدای شما را از نویز جدا میکند؟

همین تفاوت کوچک، اطلاعات ارزشمندی در اختیار سیستم صوتی گوشی قرار میدهد. وقتی فردی صحبت میکند، صدای او با اختلاف زمانی و شدت متفاوت به میکروفونهای مختلف میرسد. پردازنده گوشی میتواند از این اختلافها برای تخمین جهت منبع صدا استفاده کند و تشخیص دهد کدام سیگنال احتمالاً مربوط به گوینده اصلی است.
چند میکروفون چگونه به حذف صداهای مزاحم کمک میکنند؟
تصور کنید در خیابان مشغول صحبت با تلفن هستید. صدای شما از یک جهت به گوشی میرسد، در حالی که صدای خودروها، افراد دیگر و سایر منابع صوتی از جهات مختلف وارد میشوند.
گوشی میتواند اطلاعات دریافتشده توسط میکروفونهای مختلف را با یکدیگر مقایسه کند. این کار امکان تقویت سیگنالی را که از جهت مورد نظر میآید و کاهش سیگنالهایی را که از جهات دیگر وارد شدهاند، فراهم میکند.
یکی از فناوریهای مهم در این مرحله Beamforming یا شکلدهی پرتو است. در این روش، سیستم با استفاده از آرایهای از میکروفونها تمرکز خود را به سمت یک منبع صوتی مشخص هدایت میکند. در نتیجه، صدای فرد مورد نظر نسبت به بخشی از نویزهای اطراف برجستهتر میشود.
البته Beamforming بهتنهایی نمیتواند تمام صداهای مزاحم را حذف کند. به همین دلیل، پس از دریافت صدا مرحله دیگری از پردازش آغاز میشود.
پردازش دیجیتال وارد عمل میشود
سیگنال خامی که میکروفون دریافت میکند ترکیبی از صدای گوینده و صداهای مختلف محیط است. پردازشگر صوتی گوشی این سیگنال را بررسی میکند تا بتواند نویزهای ناخواسته را کاهش دهد.
برخی صداها نسبتاً سادهتر قابل شناسایی هستند. برای مثال، صدای یکنواخت کولر، موتور خودرو یا صدای پسزمینه ثابت را میتوان با روشهای پردازش سیگنال تا حد زیادی کاهش داد.
اما مشکل زمانی پیچیدهتر میشود که نویز محیط شبیه گفتار انسان باشد؛ برای مثال، زمانی که چند نفر همزمان صحبت میکنند. در چنین شرایطی، سیستم باید علاوه بر شدت و جهت صدا، ویژگیهای پیچیدهتر صوتی را نیز بررسی کند.
هوش مصنوعی به کمک گوشی میآید
در گوشیهای جدید، یادگیری ماشین نیز نقش مهمی در پردازش صوت دارد. مدلهای صوتی میتوانند با استفاده از نمونههای بسیار زیادی از گفتار و نویز آموزش ببینند تا تفاوت میان صدای انسان و صداهای مزاحم را بهتر تشخیص دهند.
این مدلها میتوانند به سیستم کمک کنند بخشهایی از سیگنال را که احتمالاً حاوی گفتار هستند، شناسایی کند و نویز موجود در آنها را کاهش دهد. در برخی فناوریهای پیشرفتهتر، مدلهای عصبی حتی میتوانند تلاش کنند گفتار یک فرد را از میان صدای چند گوینده یا محیطهای بسیار شلوغ استخراج کنند.
هدف این مرحله الزاماً تولید صدایی نیست که برای گوش انسان کاملاً طبیعی به نظر برسد؛ بلکه در بسیاری از کاربردها هدف اصلی، تولید سیگنالی است که سیستم تشخیص گفتار بتواند آن را بهتر درک کند.
آیا گوشی صدای شما را میشناسد؟
در اینجا باید میان دو مفهوم متفاوت تمایز قائل شد: جداسازی صدای گوینده و تشخیص هویت گوینده.
وقتی گوشی تلاش میکند صدای شما را از صدای خودروها یا افراد اطراف جدا کند، لزوماً نمیداند شما چه کسی هستید. در این مرحله فقط تلاش میکند گفتار مورد نظر را از سایر صداها استخراج کند.
اما برخی قابلیتها میتوانند از ویژگیهای منحصربهفرد صدا برای تشخیص یا تأیید هویت گوینده استفاده کنند. این قابلیت به نوع سیستم و کاربرد آن بستگی دارد.
بنابراین، وقتی دستیار صوتی گوشی در یک محیط شلوغ فرمان شما را درست متوجه میشود، این موضوع الزاماً به معنای آن نیست که گوشی هویت شما را تشخیص داده است؛ ممکن است فقط توانسته باشد گفتار شما را با موفقیت از نویز جدا کند.
از ارتعاش هوا تا تبدیل شدن به متن
پس از پردازش و پاکسازی نسبی سیگنال، مرحله تشخیص گفتار خودکار آغاز میشود. در این مرحله، سیستم صوتی تلاش میکند الگوی موجود در موج صوتی را به واحدهای زبانی و سپس کلمات تبدیل کند.
برای مثال، هنگامی که یک پیام را بهصورت صوتی دیکته میکنید، مسیر کلی چنین است: میکروفون صدا را دریافت میکند، پردازش صوتی نویز را کاهش میدهد، الگوریتمهای مربوط به گفتار سیگنال را تحلیل میکنند و در نهایت سامانه تشخیص گفتار آن را به متن تبدیل میکند.
تمام این مراحل در کسری از ثانیه انجام میشوند و به همین دلیل کاربر معمولاً متوجه زنجیره پیچیده پردازشهایی که میان گفتن یک جمله و ظاهر شدن آن روی صفحه رخ میدهد، نمیشود.
گوشی در واقع یک «گوش» واحد نیست
در نتیجه، توانایی گوشیهای هوشمند برای شنیدن صدای کاربر در محیطهای شلوغ حاصل یک فناوری واحد نیست. چند میکروفون، آرایههای صوتی، پردازش سیگنال دیجیتال، Beamforming، الگوریتمهای حذف نویز و مدلهای یادگیری ماشین همگی در کنار یکدیگر کار میکنند.
همین ترکیب باعث میشود تلفن بتواند از میان صدای خودروها، موسیقی، گفتوگوی افراد و سایر صداهای محیط، سیگنالی را که بیشترین احتمال را برای حاوی بودن گفتار کاربر دارد استخراج کند و سپس آن را در اختیار سیستم تشخیص گفتار قرار دهد.
البته عملکرد این فناوریها بینقص نیست و محیطهای بسیار شلوغ، چند گوینده همزمان، فاصله زیاد از گوشی یا صداهای ناگهانی همچنان میتوانند دقت سیستم را کاهش دهند. با این حال، پیشرفت پردازش صوت و مدلهای هوش مصنوعی باعث شده گوشیهای امروزی در شرایطی که برای یک میکروفون معمولی بسیار دشوار است، گفتار انسان را با دقت قابل توجهی تشخیص دهند.



