AIDatatech — Данные и искусственный интеллект
  • Новости
  • Генерация видео
  • Генерация изображений
  • Генерация звука
  • Генерация текста
  • Обзор сервисов
Автор

admin

admin

    Обзор сервисов

    OpenAI представила новые голосовые модели GPT-Live-1 для более естественного общения

    admin 02.09.2026


    OpenAI выпустила новые голосовые модели под названием GPT-Live-1 и GPT-Live-1 mini, заявив, что они звучат более естественно и лучше справляются с очередностью реплик в диалоге. Это полнодуплексные модели, то есть они могут говорить и слушать одновременно, позволяя пользователям естественно перебивать их и обеспечивая такие функции, как синхронный перевод.

    Компания также по умолчанию заменяет текущий режим Advanced Voice Mode в ChatGPT на GPT-Live-1 mini. Пользователи платных тарифов смогут получить доступ к более крупной модели GPT-Live-1. Предыдущая модель сочетала модель распознавания речи для транскрибации, большую языковую модель для генерации ответов и модель преобразования текста в речь для озвучивания итогового ответа.

    На пресс-брифинге компания заявила, что новые модели решают такие проблемы, как перебивание пользователей во время их речи и недостаточный уровень интеллектуальности для ответов на вопросы. Новые модели OpenAI будут отправлять запрос в новейшие текстовые модели компании, такие как GPT-5.5, для поиска, рассуждений или агентных возможностей, продолжая при этом разговор.

    OpenAI также показала, что модель может долго сохранять молчание и воспринимать контекст разговора, пока к ней не обратятся. Кроме того, поскольку новый голосовой режим имеет доступ к более новым моделям GPT, он также может представлять некоторую информацию в визуальном формате. Другие стартапы, такие как Monogram, привлекший $40 млн посевного финансирования от DST и Lux Capital, также делают ставку на визуальные ответы, чтобы сделать ассистентов более интерактивными.

    Компания заявила, что новый голосовой режим в ChatGPT рассчитан на более длительные разговоры. Во время брифинга руководитель продукта ChatGPT Voice Атти Элети сказал, что во время прогулок у него бывали 30–40-минутные разговоры с голосовой функцией.

    OpenAI считает, что голос может стать основным интерфейсом для взаимодействия с вычислительными системами при выполнении сложной работы. В сообщениях предполагалось, что компания может выпустить пару наушников с ИИ-возможностями уже в этом году. Однако она не предоставила никакой информации об аппаратных продуктах.

    «Со временем, как мы полагаем, это также откроет возможность использовать голос как своего рода основной интерфейс для взаимодействия с вычислительными системами и для управления всё более сложной долгосрочной агентной работой. Те поразительные сценарии использования, которые мы видим у людей, применяющих Codex и ChatGPT, — мы считаем, что голос может стать будущим интерфейсом для самых разных видов работы», — сказал Элети.

    В последние несколько лет OpenAI работала над усилением голосовых функций, чтобы голосовой режим ChatGPT звучал более естественно. Компания заявила, что более 150 млн человек общаются с ChatGPT с помощью таких функций, как Voice и Dictation.

    Конкуренты также пытаются сделать ассистентов более выразительными.

    И Apple, и Amazon обновили своих ассистентов, сделав их более разговорными и улучшив работу с контекстом. Стартапы вроде Sesame, основанного сооснователем Oculus Бренданом Айрибе и Анкитом Кумаром, также запустили ИИ-ассистентов с более естественным общением, которые при этом выполняют задачи в фоновом режиме.

    OpenAI движется в том же направлении, стремясь позволить пользователям дольше общаться с её ассистентом без помощи рук. Несмотря на заявление о том, что новый голосовой режим звучит более естественно, компания подчеркнула, что не стремится сделать его ИИ-компаньоном. Она отметила, что в новые модели встроены защитные механизмы, позволяющие давать подросткам ответы, соответствующие их возрасту.

    Новый голосовой режим всё ещё нуждается в доработке. Во время демонстрации, когда компания показывала функцию синхронного перевода на хинди, у ассистента был сильный американский акцент, а его речь на хинди звучала неестественно и имела слегка книжный тон. Компания заявила, что новый режим оптимизирован для «самых распространённых языков», но не уточнила, каких именно.

    Источник: TechCrunch



    Источник

    02.09.2026 0 комментариев
    0 VKOdnoklassnikiEmail
  • Обзор сервисов

    Как создать видео с эффектом Soul в Higgsfield AI: пошаговое руководство

    admin 02.09.2026
    02.09.2026

    ???? Введение Higgsfield AI — мощная нейросеть для генерации видео с уникальными визуальными эффектами. Один из самых узнаваемых среди них …

    0 VKOdnoklassnikiEmail
  • Новости

    Mac становится ИИ‑платформой Apple: спрос на локальные модели разогнал продажи и привёл к дефициту Mac mini и Studio

    admin 02.09.2026
    02.09.2026

    В свежем квартальном отчёте Apple на первый план вышли продажи iPhone и доходы от сервисов, однако наиболее показательной «тихой» историей …

    0 VKOdnoklassnikiEmail
  • Генерация звука

    ElevenLabs теперь можно подключить к Claude через MCP

    admin 02.09.2026
    02.09.2026

    ElevenLabs представила MCP-сервер для Claude. Он позволяет управлять агентами ElevenLabs из чата в Claude. Коннектор уже появился в каталоге Claude: …

    0 VKOdnoklassnikiEmail
  • Генерация текста

    Alibaba представила Qwen 3.8‑Max на 2,4 трлн параметров — открытые веса выйдут на следующей неделе

    admin 02.09.2026
    02.09.2026

    Alibaba представила Qwen3.8‑Max — новую флагманскую ИИ-модель с 2,4 трлн параметров. Сейчас она доступна в Qwen Studio и через API, …

    0 VKOdnoklassnikiEmail
  • Генерация текста

    OpenAI урезала лимиты ChatGPT и Codex? Что известно

    admin 01.09.2026
    01.09.2026

    Пользователи ChatGPT/Codex с подписками Plus и Pro в последние дни жалуются, что недельный лимит стал расходоваться заметно быстрее. Несколько человек …

    0 VKOdnoklassnikiEmail
  • Генерация видео

    Google довела ролики Gemini Omni до сорока секунд и сделала черновики втрое дешевле

    admin 01.09.2026
    01.09.2026

    Gemini Omni 1.1 Flash научилась достраивать снятую сцену продолжениями и доводить ролик до сорока секунд, а перед чистовой генерацией показывать …

    0 VKOdnoklassnikiEmail
  • Обзор сервисов

    GPT-5.5-Cyber. Почему новую версию не покажут обычным пользователям

    admin 01.09.2026
    01.09.2026

    Недавно британский государственный институт, который проверяет ИИ-модели на предмет опасных способностей, дал нейросети GPT-5.5 необычную задачу. Ей подсунули программу со …

    0 VKOdnoklassnikiEmail
  • Обзор сервисов

    OmniVoice от Xiaomi. Как работает ИИ, способный говорить на сотнях языков

    admin 01.09.2026
    01.09.2026

    Несколько секунд чьего-то голоса, и нейросеть от Xiaomi уже готова заговорить этим голосом хоть на суахили, хоть на узбекском. Да …

    0 VKOdnoklassnikiEmail
  • Обзор сервисов

    Как оплатить Higgsfield AI и какие есть тарифы: подробный гайд

    admin 01.09.2026
    01.09.2026

    ???? Введение С каждым днём всё больше пользователей интересуются продвинутыми возможностями нейросети Higgsfield AI — от уникальных эффектов до создания …

    0 VKOdnoklassnikiEmail
Новые
Старые

Свежие записи

  • Alibaba запретит своим сотрудникам использовать ИИ-инструмент Claude Code
  • Midjourney хочет доказать, что Disney и Universal сами обучают ИИ на чужом контенте
  • ИИ-помощник Roblox получил новые агентные инструменты для разработки и тестирования игр
  • 20 промтов для осенней ИИ-фотосессии в нейросетях
  • Microsoft сократила около 4 800 сотрудников на фоне масштабной реструктуризации Xbox

Свежие комментарии

Нет комментариев для просмотра.

Новые статьи

  • Alibaba запретит своим сотрудникам использовать ИИ-инструмент Claude Code

    18.09.2026
  • Midjourney хочет доказать, что Disney и Universal сами обучают ИИ на чужом контенте

    18.09.2026
  • ИИ-помощник Roblox получил новые агентные инструменты для разработки и тестирования игр

    18.09.2026
  • 20 промтов для осенней ИИ-фотосессии в нейросетях

    18.09.2026
  • Microsoft сократила около 4 800 сотрудников на фоне масштабной реструктуризации Xbox

    17.09.2026
  • Discord признал, что из-за бага в ИИ-системе модерации были ошибочно забанены тысячи пользователей

    17.09.2026

Рубрики

  • Генерация видео (108)
  • Генерация звука (23)
  • Генерация изображений (89)
  • Генерация текста (68)
  • Новости (74)
  • Обзор сервисов (51)

Alibaba запретит своим сотрудникам использовать ИИ-инструмент Claude Code

18.09.2026

Midjourney хочет доказать, что Disney и Universal сами...

18.09.2026

ИИ-помощник Roblox получил новые агентные инструменты для разработки...

18.09.2026

20 промтов для осенней ИИ-фотосессии в нейросетях

18.09.2026

Microsoft сократила около 4 800 сотрудников на фоне...

17.09.2026

Обзоры

  • Alibaba запретит своим сотрудникам использовать ИИ-инструмент Claude Code

    18.09.2026
  • Midjourney хочет доказать, что Disney и Universal сами обучают ИИ на чужом контенте

    18.09.2026
  • Microsoft сократила около 4 800 сотрудников на фоне масштабной реструктуризации Xbox

    17.09.2026

Выбор редакции

  • OpenAI и Broadcom представили Jalapeño — чип для ускорения ChatGPT, Codex и будущих агентов

    09.07.2026
  • Lightricks анонсировала LTXV-13B: новую эру в генерации видео

    19.07.2026
  • Как получить промокоды для Higgsfield AI: все способы и советы

    11.09.2026
  • Email
  • Vk
  • Rss
  • Yandex

@2026- All Right Reserved.


Наверх
AIDatatech — Данные и искусственный интеллект
  • Новости
  • Генерация видео
  • Генерация изображений
  • Генерация звука
  • Генерация текста
  • Обзор сервисов