بهبود کیفیت صدای انسانی، ترجمه همزمان و تجربه تعامل طبیعیتر؛ نوآوریهای جدید در نسخه صوتی ChatGPT

طبق گزارش ایتنا و به نقل از The Decoder، بر اساس اطلاعات رسمی که از سوی OpenAI منتشر شده، نسخه جدید «حالت پیشرفته صوتی» (Advanced Voice Mode) اکنون قابلیتهای بیشتری در بازتولید صداهایی با لحن طبیعی، حس همدلی، طعنه، مکثهای انسانی و حتی ابراز احساسات دارد.
به این معنی که ChatGPT قادر است مانند یک گوینده واقعی، احساسات را در صدایش القا کند؛ چه با لحن دلسوزانه پاسخ دهد و چه با طعنه سخن بگوید.
ترجمه همزمان، بدون وقفه
یکی از ویژگیهای اصلی افزودهشده در این نسخه، امکان «ترجمه همزمان گفتگو» بین زبانهای مختلف است. کاربران میتوانند از ChatGPT درخواست کنند تا مکالمهای میان دو زبان خاص را بهصورت زنده ترجمه کند.
OpenAI پیشنهاد میکند که این ویژگی میتواند در شرایط واقعی مانند سفارش غذا در یک رستوران خارجی، برگزاری جلسات کاری چندزبانه یا حتی مکالمه با یک گردشگر در خیابان، بسیار مفید باشد.
قابل ذکر است که شرکتهایی مانند گوگل اخیراً ویژگیهای مشابهی را در اپلیکیشن Gemini معرفی کردهاند، اما OpenAI بهدنبال این است که از طریق تمرکز بر کیفیت صوت، هماهنگی عاطفی و تعامل طبیعی، تجربهای متفاوت و بیشتر متناسب با کاربران ایجاد کند.
چالشهای موجود که هنوز حل نشدهاند
علیرغم این پیشرفتها، OpenAI بهوضوح اذعان دارد که هنوز برخی مشکلات در عملکرد صوتی این سیستم وجود دارد. یکی از این مشکلات، «افت کیفیت صدا» است که میتواند بهصورت مقطعی با تغییر ناگهانی زیر و بمی (pitch) یا شدت صدا (volume) همراه باشد. این مسئله در برخی از صداهای انتخابی کاربران بیشتر مشهود است.
مشکل دیگری که وجود دارد، پدیدهای بهنام «توهم صوتی» (audio hallucination) است—حالی که در آن ChatGPT صداهایی تولید میکند که اصلاً درخواستی برای آنها نشده است. این صداها ممکن است بهصورت نویزهای بیمعنا، قطعهای از موسیقی پسزمینه، یا حتی شبیه به تبلیغات رادیویی نمایان شوند.
در یکی از موارد گزارششده از سوی کاربران، ChatGPT در وسط یک مکالمه بهطور ناگهانی صدای تبلیغاتی پخش کرد؛ در حالی که OpenAI اصولاً هیچ تبلیغی در پلتفرم خود قرار نمیدهد. این موضوع سؤالاتی در مورد منبع این صداها و نقش دادههای آموزشی در ایجاد چنین رفتارهایی را برانگیخته است.
از گفتگوهای ماشینی تا تعامل انسانی
قابلیت صوتی پیشرفته ChatGPT برای نخستین بار در مه ۲۰۲۴ بهصورت آزمایشی ارائه شد و از اکتبر همان سال، دسترسی آن به کاربران اتحادیه اروپا نیز گسترش یافت.

گفته میشود هدف اصلی OpenAI از بهبود این قابلیت، ایجاد فضایی برای مکالمهای روان، طبیعی و زنده میان انسان و ماشین بوده است؛ گفتگویی که در آن کاربر میتواند مانند یک مکالمه تلفنی، صحبتهای دستیار هوشمند را قطع کند یا احساساتش را منتقل کند و در عوض، پاسخهایی با طعمی انسانی دریافت کند.
از سایر امکانات این نسخه نیز میتوان به توانایی ChatGPT در تفسیر بصری اشاره کرد. اگر کاربر دوربین دستگاه خود را فعال کند، هوش مصنوعی میتواند بهصورت زنده اشیاء موجود در تصویر یا محیط اطراف را شناسایی کند و درباره آنها توضیح دهد؛ قابلیتی که در زمینههای مختلفی از آموزش تا راهنمایی مسافران کاربرد دارد.
آیندهای نزدیک با مترجمان هوشمند و همراهان صوتی
به نظر میرسد با پیشرفت این قابلیتها، فاصله میان انسان و هوش مصنوعی به سرعت در حال کاهش است. اگر قبلاً ترجمه همزمان یا صدای طبیعی فقط در فیلمهای علمیتخیلی قابل تصور بود، امروز این قابلیتها در اختیار کاربران گوشیهای هوشمند قرار گرفتهاند.
با این حال، کارشناسان هوش مصنوعی هشدار میدهند که نباید فراموش کرد این ابزارها هنوز از درک واقعی زبان و احساسات انسانی بیبهرهاند و عمدتاً بر اساس الگوهای آماری عمل میکنند. بنابراین بهرهبرداری مؤثر از این فناوریها مستلزم استفاده آگاهانه و درک محدودیتهای آنهاست.



