Пекинский университет, Университет Цинхуа и Alibaba представили SparkDiffusion с открытым исходным кодом для генерации WAN-видео до 265 раз быстрее

Исследователи из Пекинского университета, Университета Цинхуа и Alibaba опубликовали в открытом доступе SparkDiffusion — фреймворк для ускорения обработки видеомоделей с использованием диффузионно-трансформаторного алгоритма, ориентированный на платформы Alibaba Wan 2.1 и Wan 2.2. В ходе тестов команда обнаружила, что генерация 81-кадрового видео длительностью около пяти секунд в разрешении 720p с помощью Wan2.1-T2V-14B сократилась с 4769 секунд до 18 секунд на одной видеокарте RTX 5090, что в 265 раз быстрее по сравнению с базовым алгоритмом с плотной структурой данных (50 шагов) без использования классификатора. На H100 та же задача сократилась с 1757 секунд до 8 секунд, то есть в 220 раз быстрее.
Работа начинается с того, что авторы называют ловушкой высокой разреженности. Увеличение разреженности внимания с 90% до 97% оставляет всего 3% блоков внимания, и на этом уровне потери при обучении продолжают падать, в то время как видео демонстрируют нарушенную структуру, дрейфущий фон и нестабильное движение. Более длительное обучение, около 30 000 обучающих видео и более крупные ветви компенсации не решили проблему. Замена предсказаний плотного учителя только на пять этапов выборки с наибольшим уровнем шума устранила большую часть конечной ошибки, указывая на ранние этапы формирования структуры.
Таким образом, SparkDiffusion сначала адаптирует разреженную модель к грубому априорному распределению, а затем корректирует окончательное распределение выходных данных в три этапа. Короткий подготовительный этап адаптирует модель к 97% разреженности с помощью RoLA, модуля внимания, который сопоставляет блочно-разреженную ветвь с низкоранговой линейной ветвью для сохранения глобального контекста. Затем CrossDistill создает трехэтапного ученика, которому не требуется руководство без классификатора, используя один шаг согласования при высоком уровне шума и два шага сопоставления распределений при низком уровне шума; при 97% разреженности он показал результат 83,15 на VBench и 58,05 на VBench-2.0, что выше, чем у любого из методов по отдельности. Наконец, линейные проекции квантуются до FP8 с помощью объединенных ядер, так что теоретическая экономия проявляется как реальная задержка GPU.
Среди других опубликованных результатов — сокращение времени выполнения Wan2.1-T2V-1.3B при разрешении 480p со 182 секунд до 1,3 секунды на RTX 5090, и Wan2.2-T2V-A14B при разрешении 720p с 4545 секунд до 25,1 секунды, что составляет 181-кратное увеличение. Код размещен на GitHub под названием AlibabaResearch под лицензией Apache 2.0, а контрольные точки преобразования текста в видео и изображения в видео при разрешении 480p и 720p были опубликованы на Hugging Face 25 сентября.
Команда планирует распространить этот подход на создание всенаправленных моделей с более высоким разрешением, авторегрессивные видеомодели и модели мира, где более длинные последовательности приводят к более дорогостоящим структурным ошибкам на ранних этапах.
Источник: Pandaily
