OpenAI представила GPT‑Realtime‑2 та два нових голосові варіанти, доступні лише через API
OpenAI розширює можливості голосового API
Компанія оголосила про запуск нових функцій для свого API, які дозволять розробникам створювати більш «живі» голосові застосунки: вони зможуть спілкуватися з користувачами, транскрибувати мову в текст і перекладати розмови на льоту.
Нове покоління моделей Realtime
Через інтерфейс Realtime тепер доступні три моделі:
МодельНазначенняКлючові особливостіGPT‑Realtime‑2Голосова взаємодія у реальному часіАналіз запитів, виклик інструментів, обробка виправлень і плавне продовження діалогу. Заснована на логіці GPT‑5, що дозволяє обробляти більш складні завдання порівняно з GPT‑Realtime‑1.5.GPT‑Realtime‑TranslateПереклад у реальному часіПідтримує 70+ мов введення та 13 мов виведення. Зберігає зміст навіть при зміні контексту, регіональних акцентів або спеціалізованої термінології.GPT‑Realtime‑WhisperТранскрипція мовиПотокова модель з низькою затримкою, що перетворює аудіо в текст майже миттєво.
> «Наші нові моделі перекладають аудіо у реальному часі із простого діалогу в голосові інтерфейси, які справді можуть працювати: слухати, роздумувати, перекладати, транскрибувати і виконувати дії по мірі розвитку розмови», — заявила компанія.
Вартість
МодельЦінаGPT‑Realtime‑2$32 за 1 млн вхідних аудіотокенів, $0.40 за 1 млн кешованих токенів і $64 за 1 млн вихідних аудіотокенівGPT‑Realtime‑Translate$0.034 на хвилинуGPT‑Realtime‑Whisper$0.017 на хвилину
Як спробувати
Розробники можуть протестувати нові моделі на онлайн-платформі OpenAI Playground і одразу побачити, як вони працюють у реальному часі.
Коментарі (0)
Поділіться своєю думкою — будь ласка, будьте ввічливі та по темі.
Увійдіть, щоб коментувати