Нейросеть OmniHuman: говорящий аватар из фото

Версия *

Лицо крупным планом, JPG или PNG

MP3, WAV, M4A или OGG, до 50 МБ — по ней строится речь

Напишите пару слов или приложите снимок — составим подробный промпт. Обычно 1 ₽
Длительность, сек
Формат файла

53 ₽ с подпиской · подробнее

Результаты появятся здесь после генерации

Срок хранения файлов зависит от тарифа

Похожие нейросети

Цены по версиям

Возможности каждой версии и цена по всем трём тарифам рядом

Версия Возможности модели Без подписки Стандарт ПРО
1 Топ Новинка Предыдущее поколение, дешевле 83 ₽/5-секундное видео 53 ₽/5-секундное видео 49 ₽/5-секундное видео
1.5 Новинка Естественные жесты и движение всего человека в кадре 111 ₽/5-секундное видео 74 ₽/5-секундное видео 69 ₽/5-секундное видео

OmniHuman — что это за нейросеть

OmniHuman — модель ByteDance, которая делает из одной фотографии говорящее видео: движение губ, мимика и жесты строятся по приложенной звуковой дорожке. Версию 1.5 отмечают за естественность жестов и за то, что она не ограничивается лицом — в кадре двигается весь человек. Работает только в паре «фото + звук»: без дорожки модель не запускается.

Как работает OmniHuman

  1. По фотографии строится модель человека в кадре.

  2. Звуковая дорожка задаёт речь, мимику и жесты.

  3. Описание помогает задать характер движения.

Как пользоваться

  1. Приложите фото человека — крупным планом, лицо целиком.

  2. Приложите звуковую дорожку с речью.

  3. Опишите, как человек должен себя вести, если это важно.

  4. Нажмите «Сгенерировать» — цена на кнопке уже учитывает вашу подписку.