بهبود کیفیت صدای انسانی، ترجمه همزمان و تجربه تعامل طبیعی‌تر؛ نوآوری‌های جدید در نسخه صوتی ChatGPT

شرکت OpenAI در جدیدترین به‌روزرسانی خود، به‌طور قابل توجهی ویژگی‌های صوتی دستیار هوشمند ChatGPT را بهبود بخشیده است؛ بهبودی که نه تنها باعث طبیعی‌تر شدن صدا می‌شود، بلکه امکان ترجمه همزمان گفتگوها را نیز برای کاربران فراهم می‌آورد.

 

طبق گزارش ایتنا و به نقل از The Decoder، بر اساس اطلاعات رسمی که از سوی OpenAI منتشر شده، نسخه جدید «حالت پیشرفته صوتی» (Advanced Voice Mode) اکنون قابلیت‌های بیشتری در بازتولید صداهایی با لحن طبیعی، حس همدلی، طعنه، مکث‌های انسانی و حتی ابراز احساسات دارد.

به این معنی که ChatGPT قادر است مانند یک گوینده واقعی، احساسات را در صدایش القا کند؛ چه با لحن دلسوزانه پاسخ دهد و چه با طعنه سخن بگوید.

 

ترجمه همزمان، بدون وقفه


 

یکی از ویژگی‌های اصلی افزوده‌شده در این نسخه، امکان «ترجمه همزمان گفتگو» بین زبان‌های مختلف است. کاربران می‌توانند از ChatGPT درخواست کنند تا مکالمه‌ای میان دو زبان خاص را به‌صورت زنده ترجمه کند.

 

OpenAI پیشنهاد می‌کند که این ویژگی می‌تواند در شرایط واقعی مانند سفارش غذا در یک رستوران خارجی، برگزاری جلسات کاری چندزبانه یا حتی مکالمه با یک گردشگر در خیابان، بسیار مفید باشد.

 

قابل ذکر است که شرکت‌هایی مانند گوگل اخیراً ویژگی‌های مشابهی را در اپلیکیشن Gemini معرفی کرده‌اند، اما OpenAI به‌دنبال این است که از طریق تمرکز بر کیفیت صوت، هماهنگی عاطفی و تعامل طبیعی، تجربه‌ای متفاوت و بیشتر متناسب با کاربران ایجاد کند.

 

چالش‌های موجود که هنوز حل نشده‌اند


 

علیرغم این پیشرفت‌ها، OpenAI به‌وضوح اذعان دارد که هنوز برخی مشکلات در عملکرد صوتی این سیستم وجود دارد. یکی از این مشکلات، «افت کیفیت صدا» است که می‌تواند به‌صورت مقطعی با تغییر ناگهانی زیر و بمی (pitch) یا شدت صدا (volume) همراه باشد. این مسئله در برخی از صداهای انتخابی کاربران بیشتر مشهود است.

 

مشکل دیگری که وجود دارد، پدیده‌ای به‌نام «توهم صوتی» (audio hallucination) است—حالی که در آن ChatGPT صداهایی تولید می‌کند که اصلاً درخواستی برای آن‌ها نشده است. این صداها ممکن است به‌صورت نویزهای بی‌معنا، قطعه‌ای از موسیقی پس‌زمینه، یا حتی شبیه به تبلیغات رادیویی نمایان شوند.

 

در یکی از موارد گزارش‌شده از سوی کاربران، ChatGPT در وسط یک مکالمه به‌طور ناگهانی صدای تبلیغاتی پخش کرد؛ در حالی که OpenAI اصولاً هیچ تبلیغی در پلتفرم خود قرار نمی‌دهد. این موضوع سؤالاتی در مورد منبع این صداها و نقش داده‌های آموزشی در ایجاد چنین رفتارهایی را برانگیخته است.

 

از گفتگوهای ماشینی تا تعامل انسانی


 

قابلیت صوتی پیشرفته ChatGPT برای نخستین بار در مه ۲۰۲۴ به‌صورت آزمایشی ارائه شد و از اکتبر همان سال، دسترسی آن به کاربران اتحادیه اروپا نیز گسترش یافت.

 




گفته می‌شود هدف اصلی OpenAI از بهبود این قابلیت، ایجاد فضایی برای مکالمه‌ای روان، طبیعی و زنده میان انسان و ماشین بوده است؛ گفتگویی که در آن کاربر می‌تواند مانند یک مکالمه تلفنی، صحبت‌های دستیار هوشمند را قطع کند یا احساساتش را منتقل کند و در عوض، پاسخ‌هایی با طعمی انسانی دریافت کند.

 

از سایر امکانات این نسخه نیز می‌توان به توانایی ChatGPT در تفسیر بصری اشاره کرد. اگر کاربر دوربین دستگاه خود را فعال کند، هوش مصنوعی می‌تواند به‌صورت زنده اشیاء موجود در تصویر یا محیط اطراف را شناسایی کند و درباره آن‌ها توضیح دهد؛ قابلیتی که در زمینه‌های مختلفی از آموزش تا راهنمایی مسافران کاربرد دارد.

 

آینده‌ای نزدیک با مترجمان هوشمند و همراهان صوتی


 

به نظر می‌رسد با پیشرفت این قابلیت‌ها، فاصله میان انسان و هوش مصنوعی به سرعت در حال کاهش است. اگر قبلاً ترجمه همزمان یا صدای طبیعی فقط در فیلم‌های علمی‌تخیلی قابل تصور بود، امروز این قابلیت‌ها در اختیار کاربران گوشی‌های هوشمند قرار گرفته‌اند.

 

با این حال، کارشناسان هوش مصنوعی هشدار می‌دهند که نباید فراموش کرد این ابزارها هنوز از درک واقعی زبان و احساسات انسانی بی‌بهره‌اند و عمدتاً بر اساس الگوهای آماری عمل می‌کنند. بنابراین بهره‌برداری مؤثر از این فناوری‌ها مستلزم استفاده آگاهانه و درک محدودیت‌های آن‌هاست.

مشاهده بیشتر

نوشته های مشابه

دکمه بازگشت به بالا