Все модели
Видеоkuaishou

🎬Kling 2.6 (Native Audio)

Чистый аудиомикс: голос отдельно от фона, точный lip-sync

Kuaishou Kling 2.6: модель Kling с акцентом на синхронный звук в одном проходе: при включённом флаге sound диалоги, окружение и SFX генерируются вместе с видео. Топовый вариант для ASMR, talking-head и продуктовых демо со звуком.

ТипВидео (text-to-video, image-to-video)
Автор моделиKuaishou (Kling AI 2.6)
Длительность5 или 10 секунд
Цена56 / 110 / 110 / 220 токенов (см. ниже)
Пропорции16:9, 9:16, 1:1
ЗвукНативный, синхронный


Для чего она

Kling 2.6 это модель, заточенная именно под качество звука. Если Veo 3.1 даёт лучшую картинку, а Kling 3.0 лучший нарратив, то у 2.6 лучший звук:

  • Чистый аудио-микс. Голос, окружающие звуки и SFX: разные слои, не сливаются в кашу. Лучше отделение фонового шума от речи.
  • Lip-sync «как у людей». Точное совпадение с движением губ.
  • Реалистичные звуковые эффекты. Падающие предметы, шум воды, шаги по разному покрытию: модель «слышит» сцену.
  • Понимание тона и темпа. Промпт «спокойный, размеренный голос» работает; «эмоциональный, на повышенных»: тоже.
  • Пение. Модель умеет петь с контролем тона и темпа (нестабильно, но единственная в каталоге).

Когда брать Kling 2.6:

  • ASMR-ролики с детальным звуком.
  • Talking-head с говорящим персонажем (один маркетолог в кадре).
  • Продуктовые демо со звуком открытия упаковки, нажатия кнопки и т.д.
  • Короткие сценки с реалистичным окружением (дождь, кухня, улица).
  • Где звук важнее визуальной сложности.

Когда брать что-то другое:

  • Нужна сцена со сменой плана и мульти-кадровый нарратив → Kling 3.0.
  • Нужен дешёвый 1080p без обязательного аудио → Kling 2.5 Turbo Pro.
  • Кинематографический фотореализм → Veo 3.1 Quality.

Что задаёте при запуске

  • Промпт: описание сцены и/или речи. До 1000 символов.
  • Длительность: 5 или 10 секунд.
  • Соотношение сторон: 16:9, 9:16, 1:1.
  • Звук: флаг (по умолчанию выключен, чтобы не платить лишнего). Включайте, когда звук нужен.
  • Стартовый кадр: опциональное изображение для image-to-video. Если приложено, модель оживляет именно его.

Цена

Тариф зависит от длительности и наличия звука:

Без звукаСо звуком
5s56 токенов110 токенов
10s110 токенов220 токенов

Аудио увеличивает цену примерно в 2×. Если звук не нужен, не включайте флаг.


Сценарии (use cases)

Talking head

«Маркетолог в кадре говорит: "Запускаем новый продукт"». Получается человек в кадре с lip-sync.

ASMR

«Близкий план: руки складывают свитер. Звуки трения ткани, тихое дыхание». Чистая ASMR-дорожка плюс соответствующий визуал.

Продуктовое демо

«Руки распаковывают коробку с гаджетом. Звуки картонной коробки, шуршание плёнки, щелчок защёлки». Готовое короткое видео-анбоксинг.

Сценки с диалогом двух героев

«Двое за столом в кафе. Девушка: "А ты вернёшься?". Парень отвечает после паузы: "Да"». Реплики назначаются на персонажей.


Советы по промптингу

  • Назначайте реплики ролям. «Парень говорит: "..."», «Девушка отвечает: "..."», модель различает спикеров.
  • Описывайте окружающие звуки явно. «Тихий шум дождя за окном», «гул толпы», «капает кран»: попадёт в саундтрек.
  • Длинный текст не помещается в 10 секунд. Учитывайте темп речи: примерно от 12 до 15 слов на 5 секунд и от 25 до 30 на 10 секунд.
  • Для image-to-video опишите, что происходит в кадре, а не как выглядит это уже на референсе.
  • Тон голоса задаётся словами. «Спокойно», «с улыбкой», «с раздражением»: отрабатывается.

Ограничения

  • Только 5 или 10 секунд, без шагов. Нужны промежуточные значения: возьмите Kling 3.0.
  • Без мультикадровых сцен, работает только одна камера.
  • Sensitive-контент отсекается модерацией.
  • Пение: нестабильное; для музыки лучше использовать специализированный TTS/musicgen.

FAQ

Чем 2.6 отличается от 3.0?

2.6 заточена под чистый аудио-микс в одной камере. 3.0 умеет мульти-кадровые сцены, поддерживает 5 языков с диалектами и гибкую длительность от 3 до 15 с. Если нужен богатый звук в одной сцене, берите 2.6, если нарратив, 3.0.

Чем 2.6 отличается от Veo 3.1?

Veo 3.1: про кинематографический визуал; звук там experimental. Kling 2.6: про звук в первую очередь. Картинка ниже уровнем, чем у Veo Quality.

Сколько стоит со звуком и без?

Пять секунд без звука стоят 56 токенов, со звуком 110. Десять секунд без звука 110, со звуком 220.

Какие языки поддерживаются?

Основные: английский и китайский. На других языках TTS работает, но lip-sync менее точный. Если нужна явная поддержка диалогов на 5 языках с диалектами (испанский, акценты английского и т.д.): смотрите Kling 3.0.

Можно ли получить пение?

Технически да, но результат нестабильный. Для музыкальных задач это не основной инструмент.

Линейка Kling

Модели одного семейства по возрастанию цены

  1. Kling 2.5 Turbo Pro42Немое 1080p дешевле старших, с точной настройкой кадра
  2. Kling 2.6 (Native Audio)вы здесь56Чистый аудиомикс: голос отдельно от фона, точный lip-sync
  3. Kling 3.060До 15 секунд с диалогом и озвучкой, но только по тексту

Другие модели для видео

Весь каталог
Видео
bytedance

Seedance 1.0 Pro Fast

от2

Самое дешёвое видео в каталоге, чтобы проверить идею

Попробовать
Видео
bytedance

Seedance 1.0 Pro

от6

Чистая картинка до 1080p и точные операторские указания, но без звука

Попробовать
Видео
runway

Runway Aleph

от25

Правка готового ролика словами: убрать объект, сменить свет и стиль

Попробовать
Видео
google

Veo 3.1 Lite

от30

Самый дешёвый в семействе: спокойный кадр и большие объёмы

Попробовать
Видео
bytedance

Seedance 2.0 Fast

от36

То же удержание деталей, но дешевле и без 1080p

Попробовать
Видео
bytedance

Seedance 2.0

от48

Лицо, логотип и надписи не плывут от кадра к кадру

Попробовать

Попробуйте Kling 2.6 (Native Audio) прямо сейчас

Открыть в редакторе