OpenAI مدلهای صوتی GPT-Live را معرفی کرد؛ تحولی در مکالمه با هوش مصنوعی
OpenAI از دو مدل صوتی جدید رونمایی کرد که توانایی صحبت و گوش دادن همزمان دارند و میتوانند مکالمات طبیعیتر و ترجمه زنده را ممکن کنند.
شرکت OpenAI که خالق ChatGPT است، به تازگی از دو مدل صوتی جدید به نامهای GPT-Live-1 و GPT-Live-1 mini رونمایی کرده است. این مدلها که به صورت همزمان میتوانند صحبت کنند و گوش دهند، تجربه مکالمه با هوش مصنوعی را به سطح جدیدی میبرند. طبق گزارش TechCrunch، این مدلها جایگزین حالت صوتی پیشرفته فعلی در ChatGPT میشوند و امکان ترجمه زنده و قطع کردن طبیعی صحبتها را فراهم میکنند.
ویژگیهای کلیدی مدلهای صوتی جدید
برخلاف مدل قبلی که برای تبدیل گفتار به متن، پردازش متن و تبدیل دوباره به گفتار از سه مدل جداگانه استفاده میکرد، مدلهای جدید کاملاً یکپارچه هستند. این یعنی میتوانند در حین پاسخگویی، به صحبتهای کاربر نیز گوش دهند؛ قابلیتی که برای ترجمه زنده بسیار حیاتی است.
OpenAI ادعا میکند که این مدلها مشکلات رایجی مانند قطع کردن صحبت کاربر یا عدم درک کافی سوالات را برطرف کردهاند. همچنین در صورت نیاز، میتوانند سوالات را به مدلهای متنی پیشرفتهتر مانند GPT-5.5 ارسال کنند تا از قابلیتهای جستجو، استدلال یا عملکردهای عاملی بهره ببرند.
نکته جالب دیگر این است که دستیار صوتی میتواند برای مدتی طولانی سکوت کند و زمینه مکالمه را حفظ نماید تا زمانی که کاربر دوباره او را صدا بزند. بعلاوه، مدل جدید قادر است برخی اطلاعات را به صورت بصری نمایش دهد؛ قابلیتی که استارتاپهایی مانند Monogram نیز روی آن سرمایهگذاری کردهاند.
تجربه مکالمات طولانیتر و هدف تبدیل صدا به رابط اصلی
مدیر محصول بخش صدای ChatGPT، آتی التی، میگوید که خودش مکالمات ۳۰ تا ۴۰ دقیقهای با این ویژگی در حین پیادهروی داشته است. OpenAI پیشبینی میکند که صدا میتواند به رابط اصلی تعامل با کامپیوتر برای انجام کارهای پیچیده تبدیل شود. شایعاتی درباره عرضه هدفونهای مجهز به هوش مصنوعی توسط این شرکت در سال جاری وجود دارد، اما OpenAI هنوز هیچ اطلاعاتی در این باره منتشر نکرده است.
الت تاکید کرد: «با گذشت زمان، این فناوری امکان استفاده از صدا به عنوان رابط اصلی برای مدیریت کارهای پیچیده و طولانی را فراهم میکند. ما معتقدیم صدا میتواند رابط آینده برای همه نوع کارها باشد.»
رقابت در بازار و نکات امنیتی
اپل و آمازون نیز دستیارهای خود را به مکالمات طبیعیتر مجهز کردهاند و استارتاپهایی مثل Sesame هم دستیارهای صوتی پیشرفتهای عرضه کردهاند. OpenAI با حفظ تمرکز بر مکالمات طولانیتر و بدون نیاز به دست، تلاش میکند جایگاه خود را تثبیت کند.
با وجود همه پیشرفتها، این فناوری هنوز کامل نیست. در نمایش زنده، ویژگی ترجمه هندی با لهجه سنگین آمریکایی و تلفظ غیرطبیعی اجرا شد که نشان میدهد در زبانهای غیرانگلیسی جای کار زیادی دارد. از طرفی، OpenAI مکانیزمهای امنیتی برای محافظت از نوجوانان و پاسخگویی مناسب در موضوعات حساس را در نظر گرفته است، هرچند تاکید دارد که هدفش ساخت یک «همراه هوش مصنوعی» نیست.
برای کاربران ایرانی که به دنبال تجربه بهتری از دستیارهای صوتی هستند، این پیشرفتها نویدبخش است، اما عملکرد دقیق این مدلها در زبان فارسی هنوز مشخص نیست و باید منتظر آزمایشهای عملی بود.