← Back to research

CVPR 2026 / 2026

AutoCut: End-to-end advertisement video editing based on multimodal discretization and controllable generation

Zhou, M., Qin, S.Z., Li, Y.Z., Chen, Q., Jiang, P.

Co-first authorEnglish paper
AutoCut: End-to-end advertisement video editing based on multimodal discretization and controllable generation — Open full-size figure
Open full-size figure ↗

Summary

Short-form videos have become a primary medium for digital advertising, requiring scalable and efficient content creation. AutoCut is an end-to-end advertisement video editing framework based on multimodal discretization and controllable editing. It employs dedicated encoders to extract video and audio features, then applies residual vector quantization to discretize them into unified tokens aligned with textual representations, constructing a shared video-audio-text token space. Built upon a foundation model, it further develops a multimodal large language model for video editing through combined multimodal alignment and supervised fine-tuning, supporting tasks covering video selection and ordering, script generation, and background music selection within a unified editing framework.

Citation

Zhou, M., Qin, S.Z., Li, Y.Z., Chen, Q., Jiang, P., 2026. AutoCut: End-to-end advertisement video editing based on multimodal discretization and controllable generation. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 37777–37787. https://arxiv.org/abs/2603.28366

BibTeX
@inproceedings{20260330AutoCut,
  title = {AutoCut: End-to-end advertisement video editing based on multimodal discretization and controllable generation},
  author = {Zhou, Milton and Qin, Sizhong and Li, Yongzhi and Chen, Quan and Jiang, Peng},
  booktitle = {Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
  year = {2026},
  pages = {37777--37787}
}