Qwen переводчик берёт готовую запись — видео или аудио — и создаёт её версию на другом языке. В отличие от Qwen GPT, который отвечает текстом на вопросы о содержании записи, здесь результат — не ответ, а новая запись: с переведённой озвучкой, готовым видеорядом и текстовой расшифровкой одновременно.
Переводить можно записи с одним говорящим или с несколькими: интервью, лекции, подкасты, ролики, рабочие созвоны — всё, что записано на одном языке, а понять нужно на другом.
Большинство переводчиков ограничиваются текстом или в лучшем случае накладывают перевод голосом диктора поверх оригинала. Qwen переозвучка работает иначе: модель клонирует голос каждого говорящего и произносит перевод его собственным тембром. На выходе не безликая закадровая начитка, а запись, которая звучит так, будто человек в кадре сам заговорил на другом языке — перевод с сохранением голоса, а не поверх него.
В разговоре с несколькими участниками модель не путает голоса между собой: она различает говорящих и считает, сколько их в записи, — реплики каждого переводятся и озвучиваются отдельно, сохраняя тембр именно этого человека. Для интервью, диалогов и групповых записей это заметно точнее, чем перевод одним усреднённым голосом на всех.
Если на вход подано видео, в перевод идёт не только звуковая дорожка, но и видеоряд. Это помогает в двух вещах, с которыми переводчики, работающие только со звуком, справляются хуже. Во-первых, разводить омонимы — слова, которые звучат одинаково, но означают разное в зависимости от того, что происходит в кадре. Во-вторых, прочитать текст, который виден на экране: вывеску, встроенную надпись, субтитры внутри самого видео, — и учесть это при переводе.
Не нужно выбирать между переводом, озвучкой и субтитрами — все три результата приходят вместе.
Пофразная расшифровка — это не просто текст перевода, а таблица из времени реплики, оригинала, перевода и номера говорящего. Из неё собираются готовые субтитры: не нужно вручную расставлять тайминги или сверять, кому какая реплика принадлежит, — всё уже размечено.
Речь распознаётся на 60 языках, но озвучивается перевод на 29 из них. Если исходная запись на редком языке, а нужный язык перевода не входит в список из 29, — вы всё равно получите точный текстовый перевод и субтитры, но не голосовую озвучку. Список поддерживаемых языков озвучки — [подставить из продукта].
Не нужно ждать, пока запись переведёт кто-то другой, — перевод с озвучкой получаете сами, сразу после загрузки файла.
Разговорная речь с интонациями и несколькими собеседниками — ровно то, с чем модель справляется точнее всего.
Учебный материал на другом языке становится доступен сразу с переводом, озвучкой и субтитрами для дополнительной опоры.
Один ролик адаптируется под аудиторию, говорящую на другом языке, без повторной записи с нуля.
Запись переговоров переводится с сохранением того, кто что сказал, — удобно для протокола встречи на двух языках.