Skip to content

Beyond Coherence: Benchmarking Professional Editing-Technique Execution in Multi-Shot Audio-Video Generation

Sep 2026 · 1 citation · 48 references
Computer Science

TL;DR

This work introduces CutCraft, the first benchmark for editing-technique execution in multi-shot audio-video generation and designs an agentic editing baseline that decomposes generation into planning, shot-level synthesis, and post-hoc composition, explicitly realizing editing semantics such as J-cuts, L-cuts, and transition timing.

Abstract

Recent multi-shot audio-video generators can produce increasingly coherent and cinematic outputs, but coherence does not imply the ability to execute editing techniques. Professional editing depends on shot structure, transition grammar, audio-video cut relations, and montage, yet existing benchmarks largely rely on proxies such as content quality, synchronization, or physical plausibility, systematically missing whether such editing instructions are actually executed. We introduce CutCraft, the first benchmark for editing-technique execution in multi-shot audio-video generation. CutCraft extends structured multi-shot prompts with explicit editing specifications and is paired with a hierarchical hybrid evaluation framework that combines shot-structure alignment, expert-model metrics, tool-grounded multimodal judgment, and rubric-based question answering. Beyond evaluation, we design an agentic editing baseline that decomposes generation into planning, shot-level synthesis, and post-hoc composition, explicitly realizing editing semantics such as J-cuts, L-cuts, and transition timing. Across 13 state-of-the-art closed- and open-source models, CutCraft reveals a consistent gap between coherence and editing-technique execution: current systems often produce plausible multi-shot videos yet fail to execute editorial instructions reliably. We find unstable shot structures, weak control of transition execution, and sharp degradation on higher-order montage, while aesthetic quality is only weakly correlated with editing-technique compliance. The benchmark and metrics, and the editing agent baseline are available at https://github.com/AlibabaResearch/cut-craft-bench.

View source

Similar papers

Preprint Aug 2026

Thinking on Shots: Consistent Multi-Shot Video Editing with Agentic Reasoning

While generative AI has significantly advanced video editing, existing methods primarily focus on single-shot or short video clips. Editing long videos with multiple instructions remains a formidable challenge. Naive chunking strategies, e.g., fixed-duration segmentation, often lead to entity fragmentation, severe edit...

Chen-Yang Wu, Fuchen Long, Bin-Yuan Huang et al. · 0 citations
Preprint Aug 2026

CoinVE-200K: A Large-Scale High-Quality Dataset for Compositional Instruction-Guided Video Editing

The quality and diversity of instruction-based video editing datasets are steadily improving, yet existing datasets mainly focus on single editing operations and fall short in supporting compositional instruction-guided video editing. In particular, multiple editing intents must be jointly understood and faithfully exe...

Fuchen Long, Cong Wang, Zitao Gao et al. · 1 citation
#artificial intelligence Preprint Sep 2026

VideoX-Qwen: Data-Centric Instruction-Based Video Editing

VideoX-Qwen, an integrated data-construction and model-training framework for general instruction-based video editing, and a unified Qwen-Wan editor that combines multimodal semantic conditioning with dense source-video latent guidance provide a practical foundation for more capable instruction-driven video editing.

J.Jenny Li, Di Shao, Xin-Yu Chen et al. · 0 citations
Preprint Aug 2026

VideoVIBE: A Video-Grounded Diagnostic Benchmark for One-Shot Interactive Website Generation

VideoVIBE is introduced, a video-grounded benchmark that transforms human-operated webpage recordings into fine-grained diagnostic tasks and V2Lens is proposed, a training-free, evidence-grounded multi-agent system that challenges and selectively refines initial video-based diagnoses through targeted visual and source-...

Jia-Jun Xu, Yang-Hao Zhou, Jing Liao et al. · 1 citation
Preprint Aug 2026

LogiShot: Logically Coherent Cross-Shot Video Generation

LogiShot is proposed, which incorporates information through two complementary paths that jointly encodes the context video and other conditioning signals, yielding dense multimodal cues that provide visual-semantic evidence for cross-shot generation and the model maintains a visual memory of the context video througho...

Shuai Guo, Yu-Hang Yang, Zeyu Zhang et al. · 1 citation
Preprint Aug 2026

Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds

Results indicate that memory, geometric control, and rollout-aware training provide a practical foundation for generating coherent stories and continuously evolving interactive worlds.

Nan Duan, Hao-Yang Huang, Wei-Yang Jin et al. · 3 citations · ⚡1

Related blog posts

MIT News · Artificial Intelligence Sep 29, 2026

Who we become when we talk to machines

Professor Sherry Turkle’s new book, “Artificial Intimacy,” offers a withering critique of chatbots and the antisocial dynamics she believes they encourage.

We use cookies to run the site and, with your consent, for analytics and to show ads. See our Cookie Policy.