ByteDance представила Seedance 2.5: 30-секундні дублі та мультимодальні референси
Нова відеомодель створює аудіо-відеокліпи до 30 секунд за один прохід, приймає до 30 зображень і 10 відеокліпів як референси та додає редагування за часовими мітками.
Команда Seed компанії ByteDance офіційно представила Seedance 2.5 — нове покоління моделі для створення відео. У заяві, опублікованій у блозі команди, сказано, що реліз спирається на уніфіковану мультимодальну архітектуру спільної генерації аудіо та відео, започатковану в Seedance 2.0, і зосереджується на двох речах: базовій генерації та генерації, керованій референсами.
Довші дублі за один прохід
Seedance 2.5 створює високоякісні аудіо-відеокліпи тривалістю до 30 секунд за один прохід — удвічі довші за 15 секунд попередньої моделі — і підтримує кілька раундів продовження, тож користувач може додавати нові кадри до вже наявного результату. Команда повідомляє про покращення переходів між кадрами й зміни сцен, а також якості зображення, звуку та руху; разом це дає змогу збирати багатохвилинні відео з єдиною аудіовізуальною мовою — цілісну історію за один дубль, а не послідовність зшитих кліпів. Один із опублікованих прикладів веде співачку з гримерки через коридор за лаштунками на сцену в одному безперервному кадрі.
До 30 зображень, 10 відео та 10 аудіокліпів
Модель приймає до 30 зображень, 10 відеокліпів і 10 аудіокліпів як референсний матеріал за один прохід. За словами команди, більший і різноманітніший набір референсів точніше передає задум автора: модель розуміє композицію, сцени, стилі, персонажів і реквізит у наданих матеріалах та зберігає зовнішність і голоси кількох персонажів навіть у групових сценах. Окремі режими референсу також посилено: у режимі clay render користувачі задають просторову структуру, пози, траєкторії руху й кути камери за допомогою 3D-моделей без текстур, а модель дотримується цієї структури та виводить із неї фізично правдоподібне освітлення.
Редагування на рівні часових міток
Під час генерації підказки можуть керувати наративом, перспективою камери, рухом і ритмом для конкретного проміжку часу; після генерації можна змінювати персонажів, дії чи сюжетні елементи всередині кліпу, зберігаючи безперервність і реалістичність. Реліз також покращує редагування на зеленому екрані, редагування перспективи камери та редагування на основі референсів. Наприклад, під час роботи із зеленим екраном модель відтворює, як об'єкт реагує на фізику нового середовища — від напрямку коливання одягу й стану волосся до ритму ходи та взаємодії з освітленням.
Доступність і визнані обмеження
Seedance 2.5 поступово з'являється на Jimeng AI, Doubao Pro та інших платформах, а доступ через API обіцяють незабаром через BytePlus ModelArk. Окрім творчої роботи, ByteDance називає освіту — перетворення історичних подій, наукових принципів та експериментів на демонстрації, зокрема в сценарії Doubao Classroom — і промисловість, де модель використовують для синтетичних навчальних даних, навичок сприйняття й маніпуляції роботів та рідкісних сценаріїв автономного водіння. Команда також прямо називає залишкові обмеження: фізичну правдоподібність складних рухів і стабільність сцен із кількома взаємодіючими суб'єктами.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.