Теперь их пытаются встроить в контент-план, рекламные креативы и продакшен — желательно вчера, бесплатно и сразу в формате 4K с идеальной физикой ткани.
Вот тут и начинается веселье.
Отечественные генераторы видео — прежде всего Kandinsky Video от Сбера и «Шедеврум» от Яндекса — действительно умеют создавать ролики по текстовому описанию и анимировать изображения. Они работают на русском языке, доступны без VPN и не требуют иностранной карты. Но между «нейросеть делает видео на русском» и «мы заменили видеопродакшен одной кнопкой» лежит примерно такой же овраг, как между красивым AI-аватаром в презентации и человеком, который должен потом объяснить клиенту, почему у персонажа на третьем кадре внезапно стало пять пальцев.
Я разобрала, на что реально способны российские генераторы видео, где у них начинается физика из сна после тяжёлого дедлайна и какой инструмент разумнее брать под конкретную задачу.
Два главных игрока: короткий ролик против более длинной сцены
На рынке отечественных нейросетей для генерации видео сейчас заметнее всего выглядят две экосистемы.
Первая — Kandinsky Video от Сбера. В линейке есть версия Kandinsky 5.0 Video Lite, построенная на архитектуре Cross Attention DiT с двумя миллиардами параметров. Она генерирует ролики длительностью до 10 секунд, в разрешении 768×512 и с частотой 24 кадра в секунду. Доступны два базовых режима: Text-to-Video, когда видео создаётся по текстовому описанию, и Image-to-Video, когда исходная картинка превращается в движущийся фрагмент.
Вторая — «Шедеврум» от Яндекса. Он делает ролики длиной 4 секунды, также с частотой 24 fps, и сохраняет результат в MP4. На бумаге это в два с половиной раза короче, чем максимальная длительность Kandinsky. В практике разница ещё ощутимее: четыре секунды — это почти всегда один визуальный жест, один проход камеры или одна короткая трансформация. Десять секунд уже позволяют собрать небольшую микросцену, хотя и не полноценный сюжет с завязкой, кульминацией и моралью.
| Параметр | Kandinsky Video | «Шедеврум» |
|---|---|---|
| Максимальная длительность | До 10 секунд в версии 5.0 Video Lite | 4 секунды |
| Частота кадров | 24 fps | 24 fps |
| Основные режимы | Text-to-Video и Image-to-Video | Генерация видео из изображения и управление движением |
| Разрешение | 768×512 для Lite; у версии Pro заявлено до 1280×720 | Формат зависит от режима и параметров сервиса |
| Управление камерой | Через текстовый промпт и параметры генерации | Готовые движения: зум, панорама, таймлапс, вращение, подъём, морфинг, полёт |
| Доступ | Telegram-бот GigaChat, Fusion Brain, VK | Мобильное приложение и сервис «Шедеврум» |
| Бесплатный лимит | До 10 генераций в день для авторизованных пользователей | Условия зависят от текущей работы сервиса |
Таблица выглядит почти как победа Kandinsky по очкам. Но в генерации видео длина сама по себе ничего не гарантирует. Десять секунд нестабильного движения — это не преимущество, а десять секунд, за которые зритель успеет заметить, как логотип начал плавиться, лицо поплыло, а чашка в руке героя решила эмигрировать в соседний кадр.
«Шедеврум» берёт другим: интерфейс у него рассчитан не на инженера по машинному обучению, а на человека, которому нужно быстро оживить картинку. Предустановленные движения камеры снижают порог входа. Не нужно отдельно формулировать, как именно камера должна двигаться: можно выбрать зум, вращение или панораму и получить достаточно предсказуемый короткий клип.
Видеогенератор не снимает сцену. Он угадывает, какой могла бы быть сцена, если бы у него не было привычки периодически менять анатомию и законы гравитации.
Как российский ИИ для создания роликов понимает движение
Главная ошибка в разговорах о нейросетях для видео — оценивать их как улучшенную версию генератора картинок. На самом деле видео ломается не там, где картинка недостаточно красивая. Оно ломается в переходах между кадрами.
Статичное изображение может убедительно показать автомобиль, человека, архитектуру или тарелку супа. В видео нужно, чтобы объект оставался собой во времени. Машина должна продолжать ехать, лицо — сохранять черты, пальцы — не пересчитываться на каждом повороте кисти, а суп — не превращаться в жидкий металл просто потому, что модель не уверена, как выглядит движение ложки.
В Kandinsky Video используется двухэтапный пайплайн. Сначала система создаёт ключевые кадры, затем достраивает промежуточные — интерполяционные. Это логичная архитектура для коротких роликов: модель сначала фиксирует основные состояния сцены, а потом старается проложить между ними плавную траекторию.
На уровне результата это означает несколько вещей.
Во-первых, модель лучше чувствует простые и ясно описанные движения. Поворот головы, медленный наезд камеры, движение облаков, лёгкое колыхание ткани — задачи понятные. Чем меньше объектов одновременно меняют положение, тем меньше пространства для генеративного факапа.
Во-вторых, сложная хореография остаётся проблемной. Если в промпте одновременно есть человек, собака, велосипед, дождь, резкий поворот камеры, взрыв конфетти и требование сохранить надпись на футболке, нейросеть не получает бонус за старание. Она просто начинает выбирать, что сохранить, а что слегка перепридумать.
В-третьих, движение камеры и движение объекта — не одно и то же. Формулировка «камера плавно приближается к женщине» задаёт одну задачу. «Женщина идёт навстречу камере, камера отъезжает назад, на заднем плане движется автомобиль» — уже три слоя движения, каждый со своей вероятностью развалиться.
Для «Шедеврума» это особенно заметно из-за короткой длительности. Четыре секунды хорошо подходят для:
- плавного приближения к предмету;
- кругового движения вокруг объекта;
- лёгкой панорамы по изображению;
- морфинга одного состояния в другое;
- короткой петли для сторис или поста;
- оживления иллюстрации без претензии на полноценную сцену.
Сервис предлагает готовые режимы управления камерой — зум, таймлапс, панораму, вращение, подъём, морфинг и полёт. Кроме того, доступны ручные настройки траектории движения в пространстве. Это полезнее, чем кажется: в коммерческом контенте часто нужен не «вау-эффект», а аккуратный проход камеры по объекту. Ручной контроль помогает не отдавать весь креативный бюджет на милость случайного импульса модели.
Почему промпт на русском — не магическое заклинание
Обе платформы рассчитаны на работу с русским языком. Это важный практический плюс: не нужно переводить каждый запрос на английский, а потом гадать, почему «мягкое утреннее освещение» превратилось в какой-то тревожный закат из дешёвого клипа.
Но русский язык не освобождает от необходимости писать промпты структурно.
Запрос в духе «сделай красивое видео девушки в городе» слишком рыхлый. В нём нет ни характера движения, ни оптики, ни темпа, ни фокуса. Нейросеть получает набор общих пожеланий и начинает собирать усреднённую визуальную кашу.
Рабочий промпт для короткой сцены лучше раскладывать на несколько слоёв:
1. Главный объект. Кто или что находится в кадре: бариста, кроссовки, упаковка косметики, игрушечный робот, городская улица.
2. Действие. Что происходит: человек медленно поворачивает голову, пар поднимается над чашкой, камера обходит флакон справа.
3. Среда. Где всё это находится: тёмная студия, мокрый асфальт, кухня с утренним светом, минималистичный стол.
4. Камера. Нужен ли крупный план, наезд, панорама, верхний ракурс или неподвижная композиция.
5. Свет и стиль. Мягкий рассеянный свет, рекламная предметная съёмка, документальная фактура, глянцевый fashion-визуал.
6. Ограничения. Один объект в кадре, плавное движение, без смены формы упаковки, без появления дополнительных персонажей.
Порядок здесь не священный, но логика нужна. Сначала модель должна понять, что является центром сцены, а уже потом — насколько драматично вокруг этого центра должен двигаться мир.
Промпт «красивый рекламный ролик премиальной сыворотки: флакон стоит на белом камне, камера медленно приближается, мягкий боковой свет, капли воды остаются на поверхности флакона, форма упаковки не меняется» гораздо полезнее, чем «сделай дорогое красивое видео косметики». Второй вариант звучит как бриф от человека, который считает слово «премиальный» универсальным техническим заданием.
Kandinsky Video: когда нужны длина, вариативность и Image-to-Video
Kandinsky Video логичнее рассматривать не как генератор готовых рекламных роликов, а как инструмент для быстрых визуальных заготовок.
Десять секунд дают пространство для более сложной композиции. Можно показать начало движения и его завершение, сделать короткий establishing shot, собрать петлю для вертикального видео или получить фон, который потом пойдёт в монтаж. Разрешение 768×512 у версии Lite не делает модель универсальным решением для финального мастер-файла, зато подходит для концептов, сторибордов, черновых заставок и соцсетевых форматов, где ролик всё равно будет пережат платформой.
Режим Image-to-Video особенно полезен, когда у бренда уже есть визуальная база. Например, есть отрендеренный продукт, иллюстрация, обложка или кадр с нужной композицией. Вместо того чтобы просить модель заново придумать всё изображение, можно зафиксировать стартовый кадр и сосредоточиться на движении.
Это снижает хаос, но не отменяет его. Исходная картинка задаёт отправную точку, а не подписывает с ней договор о пожизненной верности. В процессе анимации всё ещё могут меняться:
- мелкие детали лица;
- текст на упаковке;
- пропорции предмета;
- количество пальцев и элементов декора;
- отражения;
- форма объектов на заднем плане.
Поэтому Image-to-Video лучше использовать для сцен, где микродетали не являются юридически значимыми. Если на упаковке должен безошибочно читаться бренд, нейросеть стоит подключать на этапе идеи или движения, а не выпускать её результат без постобработки.
У Kandinsky Video есть и важный инфраструктурный плюс: бесплатный доступ предоставляется через Telegram-бот GigaChat, платформу Fusion Brain и VK. Для авторизованных пользователей заявлен лимит до 10 бесплатных генераций видео в день. Это не бесконечный рендер-ферминг, но для поиска удачного направления вполне достаточно.
Десять генераций — это примерно тот объём, который позволяет не влюбляться в первый случайный результат. А в генеративном видео это здоровая привычка. Первый клип часто выглядит бодро ровно до момента, когда вы замечаете, что предмет в центре кадра сделал невозможный кульбит. Второй становится аккуратнее. Третий может внезапно потерять исходную композицию. Четвёртый — оказаться тем самым, который уже можно отдать монтажёру.
Что означает 2B параметров на практике
Два миллиарда параметров у Kandinsky-DiT Lite звучат внушительно, особенно в презентации с градиентным фоном. Но количество параметров не превращается автоматически в рейтинг реализма.
Оно говорит о масштабе модели и её способности учитывать сложные зависимости между текстом, объектами и кадрами. Однако конечный результат зависит не только от размера модели. Имеют значение обучающие данные, архитектура пайплайна, разрешение, длина ролика, способ обработки движения и ограничения интерфейса.
Поэтому сравнивать Kandinsky только по цифре параметров с другими видеомоделями бессмысленно. Для автора контента важнее практический вопрос: сохраняет ли модель ключевой объект, понимает ли простое действие, даёт ли достаточно попыток и позволяет ли быстро забрать результат в монтаж.
В этом смысле Kandinsky выглядит сильнее там, где нужно получить несколько вариантов одной идеи. Например:
- разные движения камеры вокруг одного изображения;
- несколько настроений для одного рекламного сюжета;
- фоны и перебивки для коротких роликов;
- черновые визуализации сценария;
- анимированные изображения для соцсетей;
- тесты будущего креатива до заказа полноценной съёмки.
«Шедеврум»: короткая дистанция и управление камерой
«Шедеврум» — более компактный инструмент. Его не стоит мучительно заставлять изображать десятисекундную мини-драму. Он лучше чувствует себя в формате короткого визуального импульса: один объект, одно движение, одна эмоция.
Это подход, который хорошо совпадает с логикой соцсетей. В ленте часто не нужен автономный фильм. Нужны первые секунды, которые останавливают скролл. Ожившая иллюстрация, плавный зум на деталь, неожиданное превращение предмета, короткий полёт камеры над сценой — всё это может работать как крючок для Reels, Shorts или сторис.
Четыре секунды также проще контролировать. Чем короче ролик, тем меньше времени модель должна удерживать постоянство персонажа и окружения. Это не делает генерацию стабильной по умолчанию, но уменьшает площадь, на которой может случиться визуальный апокалипсис.
Сильная сторона «Шедеврума» — предустановленные режимы камеры. Для новичка это понятнее, чем бесконечный промпт с терминами вроде dolly in, orbit shot и rack focus, которые ещё нужно правильно встроить в русское описание. Для опытного автора готовые режимы тоже полезны: они ускоряют перебор и позволяют сосредоточиться на исходной картинке.
Есть и ручные настройки траектории движения в пространстве. Это уже шаг от кнопочного развлечения к инструменту для контентщика. Можно задавать не только настроение, но и характер прохода камеры. Правда, ручной контроль не превращает «Шедеврум» в полноценную систему виртуальной съёмки. Он помогает направить движение, но не гарантирует, что все предметы в кадре останутся физически убедительными.
Где «Шедеврум» уместен в контент-пайплайне
Я бы не ставила его в центр сложной воронки, где ролик должен последовательно объяснить продукт, показать несколько характеристик и привести зрителя к покупке. Четыре секунды — слишком короткое пространство для такого прогрева, если только вся смысловая нагрузка не вынесена в монтаж, титры и звук.
Зато «Шедеврум» хорошо работает как генератор отдельных фрагментов:
- заставка перед основным видео;
- визуальная перебивка между смысловыми блоками;
- анимация статичного поста;
- фон для цитаты или короткого тезиса;
- иллюстрация к посту в соцсетях;
- быстрый тест визуальной идеи;
- заготовка для рекламного креатива, который потом собирается в редакторе.
Важное слово здесь — «заготовка». Российские генераторы видео уже могут сэкономить время на поиске стоков, создании черновых раскадровок и оживлении визуалов. Но они всё ещё не отменяют монтаж, цветокоррекцию, звук, типографику и человеческое решение о том, зачем этот кадр вообще существует.
Потому что кадр, который просто красиво двигается, — это не контент. Это движущийся фон. Иногда полезный. Иногда очень дорогой способ сказать ничего.
Как выбирать российские генераторы видео под задачу
Вместо вечного вопроса «какая нейросеть лучше» я предлагаю задавать более неприятный, зато рабочий вопрос: какую часть продакшена вы хотите отдать модели?
Если нужен быстрый черновик визуальной идеи, можно начинать с любого доступного сервиса и смотреть, насколько он понимает именно вашу сцену. Если важна длительность, преимущество будет у Kandinsky Video. Если нужно быстро оживить изображение и выбрать тип движения из готовых пресетов, удобнее может оказаться «Шедеврум».
Разница выглядит так:
1. Для идей и раскадровки подойдёт Kandinsky Video. Десять секунд дают больше материала для последующего монтажа, а режим Text-to-Video позволяет быстро проверить разные трактовки сценария.
2. Для анимации готовой картинки разумно смотреть на Image-to-Video в Kandinsky или на сценарий с исходным изображением в «Шедевруме». Здесь меньше риска получить совсем не ту композицию, которую вы планировали.
3. Для короткого вертикального креатива «Шедеврум» удобен за счёт четырёхсекундного формата и готовых движений камеры.
4. Для предметной рекламы лучше заранее убрать из сцены всё лишнее. Один продукт, простой фон, медленное движение. Чем больше объектов и действий, тем сложнее потом спасать результат.
5. Для персонажного видео нужно закладывать несколько попыток и проверять лицо, руки, одежду и фон на каждом фрагменте.
6. Для ролика с текстом и логотипами нельзя полагаться на генератор как на финальный инструмент. Надписи безопаснее добавлять в видеоредакторе после генерации.
Здесь нет красивого универсального победителя. Российские ИИ-движки находятся в разных точках одного и того же пайплайна. Один даёт больше времени и режимов, другой — более простой маршрут от картинки к короткой анимации.
Лучший генератор — не тот, который обещает заменить студию. Лучший — тот, который не мешает вам закончить ролик до того, как клиент пришлёт ещё семь правок.
Скорость рендеринга, лимиты и реальность бесплатного доступа
Пользователь обычно хочет знать две вещи: сколько ждать и сколько это стоит. С ценой у отечественных сервисов ситуация привлекательнее, чем у ряда зарубежных платформ: базовый доступ к Kandinsky Video можно получить бесплатно, а авторизованным пользователям доступно до 10 генераций в день.
Но бесплатный лимит — это не гарантия промышленной производительности. Точные коммерческие условия API для корпоративных клиентов в разных конфигурациях нельзя свести к одной универсальной цифре. И реальная пропускная способность «Шедеврума» в часы нагрузки тоже не выглядит параметром, который можно честно обещать заранее.
Для автора соцсетей это означает простую вещь: не ставьте генерацию последним звеном перед публикацией.
Если ролик нужен к 18:00, нельзя открывать сервис в 17:50, писать промпт из пяти слов и надеяться, что первая попытка станет финальной. Нейросеть — это не курьер с горячей пиццей. Она может выдать хороший результат, а может подарить вам четыре секунды сюрреализма, где товар исчезает, камера телепортируется, а модельный персонаж получает новую профессию и другую форму лица.
Практичный пайплайн выглядит спокойнее:
- сначала формулируется задача ролика;
- затем создаётся или выбирается исходное изображение;
- после этого делается несколько генераций с небольшими изменениями промпта;
- лучшие фрагменты проверяются покадрово;
- затем добавляются звук, титры, логотип и монтаж;
- финальный файл проходит обычную проверку перед публикацией.
Если вы делаете серию роликов, стоит заранее определить визуальные ограничения: цвет фона, крупность плана, скорость движения, характер света и допустимую степень сюрреализма. Иначе каждый новый клип будет выглядеть как работа другого подрядчика. Один — глянец, второй — сон уставшего дизайнера, третий — трейлер к игре, которую никто не выпускал.
Почему российские сервисы сейчас особенно интересны
Доступность из России — не мелочь и не скучный технический пункт. Зарубежные сервисы вроде Runway, Midjourney и OpenAI Sora используют Stripe, который автоматически отклоняет карты с российским BIN — Visa, Mastercard и «Мир». Проблема связана с геоблоками разработчиков и ограничениями эквайринга, а не с единым решением регуляторов о запрете всех зарубежных видеогенераторов.
В результате даже хороший зарубежный сервис может оказаться непрактичным для команды, которой нужно регулярно оплачивать подписку, распределять доступы и не строить рабочий процесс вокруг сомнительных обходных схем.
Отечественные платформы в этом смысле закрывают базовую инфраструктурную боль:
- русский интерфейс и понимание русскоязычных запросов;
- доступ без VPN;
- отсутствие необходимости в иностранной банковской карте;
- интеграция с привычными экосистемами;
- бесплатный вход для первых экспериментов;
- возможность быстро проверить идею до принятия решения о платном производстве.
На фоне того, как российские ритейлеры фиксируют рост продаж необычных продуктов и аудитория всё охотнее реагирует на новые форматы, скорость эксперимента становится самостоятельным преимуществом. Не потому, что любой AI-креатив автоматически продаёт. А потому, что команда может быстрее проверить гипотезу и не тратить неделю на производство визуала, который не выдерживает даже первый скролл.
При этом доступность не равна качеству уровня мировых лидеров. Нельзя честно утверждать, что Kandinsky Video или «Шедеврум» уже превосходят по реализму и физике движения топовые модели вроде Google Veo 3.1 или Kling 3.0. У отечественных решений есть свои сильные сценарии, но это не повод включать гимн на фоне каждого удачного морфинга.
Где нейросеть всё ещё проигрывает монтажёру
Есть задачи, для которых российские генераторы видео пока разумнее использовать как вспомогательный слой.
Первая — точное сохранение брендинга. Текст, логотипы, мелкие элементы упаковки и фирменные паттерны могут деформироваться. Для рекламной кампании это не декоративный дефект, а потенциальная причина отправить ролик обратно на доработку.
Вторая — сложное взаимодействие объектов. Руки, предметы, животные и транспорт в одной сцене требуют от модели слишком много последовательной логики. Каждый объект должен двигаться не просто красиво, а физически совместимо с другими.
Третья — длинный сюжет. Даже максимальные 10 секунд Kandinsky Video — это короткий фрагмент, а не готовая история. Если нужен ролик на 30–60 секунд, генератор скорее станет фабрикой отдельных сцен, которые потом предстоит собрать в монтажной программе.
Четвёртая — точное повторение персонажа. Если вы строите сериал с одним героем, нельзя автоматически ожидать, что модель сохранит его лицо, одежду и пропорции во всех новых генерациях. Для устойчивого персонажного контента потребуется дополнительный контроль исходных изображений, монтаж и, возможно, комбинирование нескольких инструментов.
Пятая — звук. Указанные возможности относятся к генерации видеоряда. Музыку, речь, шумы и синхронизацию нужно планировать отдельно. Клип без звука часто выглядит как презентация из корпоративного чата: технически существует, эмоционально не подключается.
Что проверять в готовом клипе
Не в смысле скучного чек-листа из методички, а потому что иначе ролик уйдёт в публикацию с визуальной уликой против вас.
Посмотрите, сохраняется ли главный объект от первого кадра к последнему. Проверьте руки, глаза, зубы, отражения и надписи. Если камера приближается к продукту, не меняется ли его форма. Если в кадре есть человек, не становится ли одежда другой в середине движения. Если используется морфинг, понятно ли, что именно трансформируется, или зритель получает просто желейную кашу.
Отдельно смотрите на фон. Нейросеть может сделать его достаточно красивым, но нестабильным: окна меняют количество, линии архитектуры изгибаются, предметы появляются без причины. В коротком ролике зритель может не разобрать каждый артефакт, но мозг быстро считывает ощущение фальши.
Для публикации в соцсетях обычно важнее не максимальная детализация, а цельность первого впечатления. Лучше простой, аккуратный проход камеры по одному предмету, чем масштабная сцена, в которой всё движется, но ничему нельзя верить.
Итоги: не заменитель продакшена, а быстрый соавтор
Русские нейросети для видео уже пригодны для работы — если не заставлять их играть роль, на которую они пока не нанимались.
Kandinsky Video выглядит более универсальным вариантом для генерации сцен, черновых роликов и анимации изображений. Его сильные стороны — длительность до 10 секунд, режимы Text-to-Video и Image-to-Video, разрешение до 768×512 в версии Lite и бесплатный лимит до 10 генераций в день для авторизованных пользователей через доступные платформы.
«Шедеврум» удобнее воспринимать как быстрый инструмент для коротких визуальных импульсов. Четыре секунды, 24 fps, готовые режимы движения камеры и ручная настройка траектории делают его подходящим для соцсетей, заставок, перебивок и оживления готовых изображений.
Оба сервиса выигрывают у зарубежных альтернатив в доступности для пользователей из России: не нужен VPN, не нужна иностранная карта, не нужно превращать оплату подписки в отдельный квест с элементами финансового триллера.
Но качество результата всё ещё определяется не только моделью. Слабый промпт, перегруженная сцена и отсутствие монтажа не становятся сильными сторонами после добавления слова «нейросеть». Генератор может ускорить производство, предложить неожиданный визуальный ход и спасти контент-план в момент, когда стоковые видео закончились ещё вчера.
А вот смысл, драматургию и финальное решение он пока с удовольствием оставляет человеку. К счастью. Иначе индустрия получила бы бесконечный поток гладких четырёхсекундных роликов, а мы все окончательно перестали бы понимать, зачем их смотрим.




