Как нейросеть переводит видео. Часть 1: Whisper врёт, и мы это знаем
Я один пишу сервис дубляжа видео с 2022 года, когда OpenAI выложил Whisper и мне показалось, что дело на месяц. В 2026-м через конвейер прошло 9 203 задачи, и он ломается в тех же местах, что и в первый. Первая часть из трёх: как звук становится текстом с таймкодами и спикерами. Три типа галлюцинаций Whisper и ловушки на каждый с кодом, почему мы выбрасываем его сегменты и собираем предложения сами, каскад на своей видеокарте с запасными выходами, хинди, который молча терял по 15 секунд речи, и честное ограничение: двое говорящих одновременно не бывает.
Читать далее
Источник: habr.com
Похожие записи
Оцените материал:
Похожие записи
Anthropic расширила доступ к «облачным» сессиям в Claude Code и дала бесплатные бонусы на $100 и $250 для подписчиков Pro и Max
26.09.2026
Открытая платформа EnvHarness от Google позволяет агентам искусственного интеллекта обучаться в средах, которые меняются вместе с ними.
26.09.2026
По случаю, по принуждению, по желанию. Как и почему меняли фамилию в российской истории
26.09.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
