Нейросети для создания видео: таблица моделей и что они реально умеют

.cibt{width:100%;border-collapse:collapse;font-size:15px}.cibt th,.cibt td{padding:8px;border:1px solid #e2e2e6;text-align:left;vertical-align:top}.cibt th{background:#f4f4f6}.cibt tr:nth-child(even) td{background:#fafafb}.cib-id{color:#888;font-size:13px}.cib-rub{color:#888}.cib-src{color:#888;font-size:14px}.cib-wrap{overflow-x:auto}

Генерация видео — самая дорогая в вычислениях задача из всех, которые сегодня решают нейросети, и именно поэтому вокруг неё больше всего завышенных ожиданий. Ролик из одной фразы действительно получается, но он короткий, стоит заметных денег и почти никогда не выходит с первого раза. Ниже — что эти модели реально умеют, таблица из 68 моделей у 10 провайдеров и разбор того, на чём чаще всего спотыкаются. Данные обновлены 07.09.2026.

Три разных задачи, которые называют одним словом

Видео из текста. Вы описываете сцену, модель создаёт ролик с нуля. Самый эффектный и самый непредсказуемый режим: вы не контролируете, как будет выглядеть кадр, пока не увидите результат.

Видео из изображения. Вы даёте готовую картинку и описываете движение. Управляемость несравнимо выше: композиция, персонаж и стиль уже зафиксированы, модель добавляет только движение. Для практической работы это основной режим — таких моделей в таблице 32.

Видео из видео. Перерисовка существующего ролика в другом стиле или замена элементов. Требует исходника, зато сохраняет движение и тайминг — то, что генератору даётся труднее всего.

Практический вывод: если задача не «удивить», а «получить нужный кадр», начинайте не с текста, а с картинки. Сначала добейтесь нужного изображения генератором картинок, потом оживляйте его.

Чего ждать реалистично

Длительность

Единица генерации — секунды, а не минуты. Длинный ролик собирается из отдельных фрагментов, и главная сложность именно в стыковке: между двумя сгенерированными кусками персонаж меняется в мелочах. Поэтому монтаж и подбор кадров занимают больше времени, чем сама генерация.

Согласованность

Самое слабое место. Один и тот же человек в двух соседних фрагментах может отличаться причёской, одеждой и чертами лица. Лечится подачей опорного изображения и фиксацией случайного зерна, но полностью проблема не решена ни у одной модели.

Физика и мелкая моторика

Руки, пальцы, взаимодействие предметов, вода, дым — всё это по-прежнему выдаёт машинное происхождение. Правило простое: чем сложнее взаимодействие в кадре, тем выше шанс артефакта. Общие планы получаются надёжнее крупных.

Текст в кадре

Надписи на вывесках, документах и экранах модель воспроизводит плохо, а на кириллице — особенно плохо. Если текст важен, его добавляют на монтаже, а не просят у генератора.

Звук

Часть моделей генерирует видео со звуком, часть — немое видео. На практике звук всё равно чаще собирают отдельно: так им можно управлять. Озвучка и музыка — отдельный класс моделей.

Таблица моделей, которые создают видео

Отсортировано по цене входа. Колонка «из картинки» — самая полезная на практике: такие модели оживляют готовое изображение, а не выдумывают кадр с нуля.

Модель Провайдер Вход / 1M Из картинки Из видео Открытые веса
HappyHorse 1.1 Reference-to-Video Alibaba Token Plan бесплатно да
HappyHorse 1.1 Text-to-Video Alibaba Token Plan бесплатно
HappyHorse 1.1 Image-to-Video Alibaba Token Plan бесплатно да
HappyHorse 1.1 Reference-to-Video Alibaba Token Plan (China) бесплатно да
HappyHorse 1.1 Text-to-Video Alibaba Token Plan (China) бесплатно
HappyHorse 1.1 Image-to-Video Alibaba Token Plan (China) бесплатно да
cosmos-transfer1-7b Nvidia бесплатно да да да
cosmos-transfer2.5-2b Nvidia бесплатно да да да
cosmos-predict1-5b Nvidia бесплатно да да да
Wan2.2-T2V-A14B DigitalOcean $0.6 / 52.0 ₽ да
Gemini Omni Flash Preview Google $1.5 / 129.9 ₽ да да
Veo 3.1 Fast FastRouter да
Veo 3.1 FastRouter да
Veo 3.1 Lite FastRouter да
Seedance 2 FastRouter да
Wan 2.6 FastRouter да да
Veo 3.1 Google да
Veo 3.1 fast Google да да
Veo 3.1 lite Google да
Veo-3.1-Fast Poe да
Veo-3.1 Poe
Veo-3-Fast Poe
Veo-3 Poe
Veo-2 Poe
Ray2 Poe да
Sora-2 Poe да
Sora-2-Pro Poe да
Runway-Gen-4-Turbo Poe да
Runway Poe да
Kling-V2 6 Qiniu да да
Kling v2.5 Turbo Image-to-Video Vercel AI Gateway
Kling v3.0 Motion Control Vercel AI Gateway
Kling v2.6 Text-to-Video Vercel AI Gateway
Kling v2.5 Turbo Text-to-Video Vercel AI Gateway
Kling v3.0 Text-to-Video Vercel AI Gateway
Kling v2.6 Image-to-Video Vercel AI Gateway
Kling v2.6 Motion Control Vercel AI Gateway
Kling v3.0 Image-to-Video Vercel AI Gateway
MiniMax H3 Vercel AI Gateway да
MiniMax H3 Max Vercel AI Gateway да

Моделей с открытыми весами среди них 5 — их можно запустить на своём компьютере, если хватает видеопамяти. Моделей с нулевой ценой токенов 9, но у видео бесплатный доступ почти всегда означает очередь: генерация ролика занимает несоизмеримо больше вычислений, чем ответ текстом.

Сколько это стоит на самом деле

Цена в прайсе провайдера — не цена готового ролика. Между ними стоит коэффициент, о котором не пишут: количество попыток. Устраивающий результат редко получается с первого раза, и реалистично закладывать от трёх до десяти генераций на один используемый фрагмент.

Отсюда практический приём, который экономит больше всего: отрабатывать идею на самой дешёвой модели, а финальный вариант делать на дорогой. Композиция, движение камеры и тайминг видны и на черновом качестве; тратить дорогие генерации на поиск решения — самая частая ошибка новичка.

Второй приём — начинать с картинки. Сгенерировать и отобрать изображение дешевле, чем видео, а оживление готового кадра даёт предсказуемый результат с меньшего числа попыток.

Как описывать сцену

Запрос для видео отличается от запроса для картинки одним: в нём надо описать не только кадр, но и движение. Рабочая структура состоит из четырёх частей.

Что в кадре. Объект, окружение, план. Так же, как для изображения.

Что делает объект. Одно понятное действие. Две-три одновременные активности модель почти всегда смешивает в кашу.

Что делает камера. Статичный кадр, медленный наезд, проезд, облёт. Это отдельный параметр, и без него камера ведёт себя случайно.

Темп и настроение. Плавно, резко, замедленно. Влияет на итог сильнее, чем кажется.

И главное правило, общее с картинками: менять по одному параметру за раз. Переписанный целиком запрос даёт совершенно другой ролик, и понять, что сработало, становится невозможно.

Почему видео стоит дороже всего остального

Понимание устройства объясняет и цену, и ограничения. Модель генерирует не «ролик», а последовательность кадров, каждый из которых сам по себе сопоставим по сложности с одной картинкой. Секунда видео — это десятки кадров. Отсюда прямое следствие: если одна картинка обходится в какую-то сумму, то секунда видео стоит на порядок больше.

Но простое умножение здесь не работает, и в этом вся сложность. Кадры нельзя генерировать независимо: между соседними должна сохраняться связность — тот же персонаж, та же одежда, та же геометрия сцены, физически осмысленное движение. Модель вынуждена держать в расчёте весь фрагмент целиком, а не кадр за кадром. Именно эта временна́я связность и есть главная вычислительная нагрузка, и именно она первой ломается на длинных фрагментах.

Отсюда понятно, почему длительность единицы генерации измеряется секундами, а не минутами, и почему длинные ролики собирают монтажом. И почему бесплатные тарифы у видеогенераторов такие скупые: каждая генерация стоит владельцу сервиса реальных денег за вычисления, и никакая реклама этого не покрывает.

Рабочий процесс: как это делают на практике

Люди, которые получают приличный результат регулярно, почти никогда не идут по пути «написал фразу — получил ролик». Рабочая последовательность выглядит иначе и состоит из пяти шагов.

Шаг 1. Раскадровка словами. Ролик разбивается на короткие фрагменты, и для каждого записывается, что в кадре и что делает камера. Это делается до всякой генерации: так становится видно, сколько фрагментов нужно и какие из них сложные.

Шаг 2. Опорные кадры. Для каждого фрагмента сначала генерируется картинка — быстро и дёшево. Отбираются те, что устраивают по композиции, персонажу и стилю. На этом шаге решаются все вопросы внешнего вида, пока они ещё стоят копейки.

Шаг 3. Оживление. Отобранные картинки подаются в модель как опорные, а в описании остаётся только движение. Результат предсказуем, потому что кадр уже зафиксирован.

Шаг 4. Отбор дублей. На каждый используемый фрагмент генерируется несколько вариантов, из которых выбирается один. Это не расточительство, а норма процесса: заранее предсказать, какой дубль окажется чистым, невозможно.

Шаг 5. Монтаж и звук. Фрагменты собираются, добавляются надписи, музыка и озвучка. Текст в кадре делается здесь, а не просится у генератора — так он будет читаемым и на нужном языке.

Ошибки, которые выдают машинное видео сразу

Если ролик должен выглядеть достоверно, полезно знать, куда смотрит зритель в первую очередь.

Руки и пальцы. Классическая проблема, перешедшая к видео от генераторов картинок и усугублённая движением: пальцы могут менять количество прямо в кадре. Лечится выбором плана — там, где руки не в фокусе, проблемы нет.

Взгляд и моргание. У сгенерированных людей часто неестественный ритм моргания и «стеклянный» взгляд. Это то, что зритель считывает подсознательно, даже не формулируя.

Мелкие предметы в руках. Чашка, телефон, инструмент — всё, что требует контакта пальцев с объектом, деформируется чаще всего.

Отражения и тени. Модель воспроизводит их приблизительно: тень может не соответствовать источнику света, отражение в зеркале — жить своей жизнью.

Фон в движении. При проезде камеры фоновые объекты иногда плывут, меняют форму или исчезают. Заметнее всего на архитектуре с повторяющимися элементами.

Практический вывод: планируйте кадры так, чтобы сложные для модели элементы не были главными в композиции. Общий план и медленное движение камеры дают чистый результат гораздо чаще, чем крупный план с активной жестикуляцией.

Права, маркировка и репутационные риски

Права на результат. Как и с изображениями, зависят от сервиса и тарифа. На бесплатных уровнях коммерческое использование часто закрыто, и узнают об этом обычно постфактум.

Лица реальных людей. Оживить фотографию человека без его согласия — не техническая, а правовая история. Для публичных персон риск выше, а не ниже: сгенерированное видео с узнаваемым человеком, говорящим то, чего он не говорил, — это уже другая категория проблем.

Маркировка. Многие сервисы встраивают в файл невидимую метку о машинном происхождении, а площадки всё чаще требуют помечать такой контент явно. Практичнее исходить из того, что происхождение ролика устанавливается.

Репутация. Отдельный риск, не юридический: аудитория узнаёт машинное видео и реагирует на него хуже, когда оно выдаётся за съёмку. Там, где машинная природа заявлена честно, — реагирует спокойно.

Что выбрать под задачу

Короткие ролики для соцсетей. Здесь генерация работает лучше всего: длительность и так небольшая, требования к деталям невысокие. Берите модель с оживлением картинки — так вы контролируете кадр.

Фон и вставки для монтажа. Абстрактные текстуры, пейзажи, движение облаков — идеальная задача для генератора: нет ни лиц, ни рук, ни текста, то есть нечему ломаться.

Реклама товара. Осторожно. Товар в кадре должен соответствовать реальному, иначе это уже вопрос добросовестности. Рабочая схема — оживление настоящей фотографии товара, а не генерация его с нуля.

Обучающие и объясняющие видео. Генератор плохо справляется с точностью: схема будет похожа на схему, но неверной. Для этой задачи надёжнее обычные инструменты, а нейросеть оставить на заставки и переходы.

Стоит ли вообще браться: короткая проверка

Генерация видео решает не любую задачу, и честнее понять это до того, как потрачены деньги и вечер. Четыре вопроса, ответы на которые определяют исход.

Нужен ли в кадре конкретный узнаваемый объект? Если да — ваш товар, ваш сотрудник, ваше помещение, — генерация с нуля не подойдёт: модель нарисует похожее, а не то самое. Работать надо через оживление реальной фотографии.

Важна ли точность? Обучающее видео, инструкция, медицинский или технический материал — области, где правдоподобная, но неверная картинка хуже, чем её отсутствие.

Сколько фрагментов нужно? Один короткий — задача на вечер. Полноценный ролик из двадцати склеек — это уже проект с раскадровкой, отбором дублей и монтажом, и по трудозатратам он сопоставим с обычным производством.

Есть ли у зрителя ожидание достоверности? Абстрактная заставка машинного происхождения никого не смущает. Сюжетный ролик, выдаваемый за съёмку, — смущает, и негативная реакция обходится дороже сэкономленного бюджета.

Если на все четыре вопроса ответы благоприятные, генерация экономит много времени и денег. Если хотя бы на один нет — честнее либо изменить задачу, либо снимать.

Локальный запуск

Открытые модели видео можно запускать у себя, и это единственный способ работать без лимитов и без оплаты за попытку. Цена вопроса — видеопамять: требования у видео заметно выше, чем у генерации картинок, и скромной видеокартой здесь не обойтись. Зато нет ни очередей, ни ограничений сервиса, ни вопросов о том, что происходит с вашими исходниками.

Промежуточный вариант — арендовать вычисления на час у облачного провайдера: дешевле покупки железа и без лимитов готового сервиса.

Частые вопросы

Можно ли сделать видео бесплатно?

Бесплатные варианты есть, но у видео это почти всегда означает очередь и жёсткий лимит: генерация ролика требует несоизмеримо больше вычислений, чем текстовый ответ. Для проб хватит, для потока работы — нет.

Какая нейросеть лучше делает видео?

Единого лидера нет, и меняется это быстро. Практичнее выбирать по режиму работы: если нужен контроль над кадром — модель с оживлением изображения, а не генерацией из текста.

Почему у персонажа меняется лицо между кадрами?

Это главная нерешённая проблема генерации видео — согласованность. Смягчается подачей опорного изображения и фиксацией случайного зерна, но полностью не устраняется ни одной моделью.

Какой длины ролик можно сгенерировать?

Единица генерации измеряется секундами. Длинное видео собирается монтажом из фрагментов, и стыковка — самая трудоёмкая часть работы.

Можно ли оживить фотографию?

Да, это режим «видео из изображения», и он даёт самый предсказуемый результат. Но если на фотографии реальный человек — нужно его согласие.

Будет ли в ролике звук?

Зависит от модели: часть выдаёт видео со звуком, часть немое. На практике звук чаще собирают отдельно, чтобы им можно было управлять.

Сколько попыток нужно на один хороший фрагмент?

Реалистично от трёх до десяти. Поэтому черновой поиск решения имеет смысл вести на дешёвой модели, а финальную генерацию делать на дорогой.

Можно ли получить длинный ролик целиком?

Нет, единица генерации — короткий фрагмент. Длинное видео собирается монтажом, и основная работа приходится именно на стыковку: между двумя фрагментами персонаж и освещение могут заметно разойтись.

Чем видео из картинки лучше видео из текста?

Управляемостью. В режиме из текста вы не знаете, что окажется в кадре, пока не увидите результат. В режиме из картинки композиция, персонаж и стиль уже зафиксированы, и модель добавляет только движение — результат предсказуем и достигается с меньшего числа попыток.

Подойдёт ли сгенерированное видео для рекламы товара?

Только если товар в кадре — настоящий, то есть вы оживляете его реальную фотографию. Сгенерированный «с нуля» товар будет похож на ваш, но не будет им, и это уже вопрос добросовестности рекламы, а не качества модели.

Нужно ли помечать, что видео сделано нейросетью?

Многие площадки этого требуют, а сервисы встраивают невидимую метку в сам файл. Исходить стоит из того, что машинное происхождение может быть установлено.

Таблица собрана из открытого справочника models.dev, пересчёт в рубли по курсу ЦБ РФ, обновляется автоматически раз в неделю. Обновлено 07.09.2026. См. также: нейросети для изображений, бесплатные нейросети.

Прокрутить вверх