Source-linked AI summary
Multi-Block Diffusion Language Models
Yijie Jin, Jiajun Xu, Yuxuan Liu, Chenkai Xu, Yi Tu, Jiajun Li, Dandan Tu, Xiaohui Yan, Kai Yu, Pengfei Liu, Zhijie Deng
TL;DR
MultiBD는 SingleBD의 순차적 블록 병목을 극복하려 하지만, 기존 학습 상태는 이질적인 noise pattern을 갖는 bounded running-set 추론과 일치하지 않는다. 이 논문은 MultiTF와 Block Buffer decoding을 도입하며, MBD-LLaDA2-Mini는 평균 TPF를 3.47에서 6.19로 높이는 동시에 평균 accuracy를 79.95%에서 81.03%로 개선한다.
문제
기존 BD-LM은 여러 noisy block과 이질적인 noise pattern을 포함하는 bounded MultiBD running-set에 맞는 학습 상태가 부족해, 실용적인 inter-block parallelism이 제한된다.
방법
이 논문은 MultiTF로 BD-LM을 post-training하고, Block Buffer decoding을 사용해 KV-cache 재사용과 static input shapes를 유지하면서 학습을 bounded noise-group에 맞춘다.
결과
평균 TPF는 3.47에서 6.19로, 평균 accuracy는 79.95%에서 81.03%로 상승한다. DMax를 적용하면 평균 TPF는 9.34에 도달하며 accuracy는 1.02 percentage-point 하락한다.
시사점 및 한계
신뢰할 수 있는 MultiBD를 위해서는 bounded running-set 상태와의 training-time alignment와 generation quality를 유지하면서 decoding parallelism을 높이는 inference-time system support가 모두 필요하다.
시사점 및 한계
직접적인 running-set 실행은 step과 request마다 token count가 달라지게 하므로 CUDA Graph capture and replay가 어렵다.
Abstract
from arXiv · showhide
Block Diffusion Language Models (BD-LMs) improve diffusion-based text generation with KV caching and flexible-length generation. A natural next step is to extend them from Single-Block Diffusion (SingleBD) to Multi-Block Diffusion (MultiBD), where a running-set of consecutive blocks is decoded concurrently for inter-block parallelism. However, existing BD-LMs are mostly trained under teacher forcing, where the model observes only one noisy block conditioned on a clean prefix. While the recent diffusion forcing strategy introduces visibility among multiple noisy blocks, its training states still differ from MultiBD inference, where decoding operates on a bounded running-set with heterogeneous slot-wise noise patterns. To bridge this gap, we propose Multi-Block Diffusion Language Models (MBD-LMs), obtained by post-training BD-LMs with Multi-block Teacher Forcing (MultiTF). MultiTF integrates teacher forcing and diffusion forcing by training on bounded noise-groups conditioned on clean prefixes, with randomized noise-schedulers that better match MultiBD inference states. To make MultiBD practically executable, we further introduce an optimized decoding algorithm based on the Block Buffer mechanism that preserves prefix-cache reuse, keeps input shapes static, and translates increased decoding parallelism into wall-clock acceleration. Empirically, MBD-LLaDA2-Mini increases average Tokens Per Forward pass (TPF) from 3.47 to 6.19 and improves average accuracy from 79.95% to 81.03%; when combined with DMax, MBD-LLaDA2-Mini-DMax reaches an average TPF of 9.34 with only a 1.02% accuracy drop on math and code benchmarks.
1 서론
MBD-LMs는 block diffusion을 순차적인 SingleBD에서 bounded MultiBD로 확장해 MultiTF로 학습과 추론을 정렬하고, 실용적인 블록 간 병렬성을 구현한다. Block Buffer 추론 파이프라인은 caching과 고정 input shape을 유지하면서 이 병렬성을 속도 향상으로 전환한다.
- Framework: MBD-LMs는 TF-trained 및 D2F-trained BD-LMs를 통합하고, 신뢰성 높고 효율적인 추론을 위한 중간 regime로 bounded MultiBD를 규정한다.SingleBD는 clean cached prefix 뒤에서 하나의 noisy block을 디코딩하는 반면, MultiBD는 KV-cache 저장과 미래 블록 정제를 겹쳐 블록 간 병렬성을 구현한다.
- Method: MultiTF는 randomized heterogeneous noise schedule과 group-aware attention을 사용해 bounded한 연속 noisy block 그룹에서 BD-LMs를 post-train하고, 실제 MultiBD state에 맞춘다.추론 중 가능한 running-set 구성을 포괄하도록 그룹의 크기와 상대적 위치를 다양화한다.
- Inference: Block Buffer는 고정된 block slot을 유지하고 KV 및 prefix caching을 보존하며, CUDA Graph capture를 위해 input shape을 고정한 채 디코딩과 cache 저장을 겹친다.미래 블록은 유휴 slot을 활성화하고, 완료된 선행 블록은 KV cache를 커밋한 뒤 빠져나가 더 높은 TPF를 wall-clock speedup으로 전환한다.
- Experiments: MBD-LLaDA2-Mini의 TPF는 LLaDA2-Mini 대비 3.47에서 6.19(+78.4%)로, 평균 정확도는 79.95%에서 81.03%로 상승한다.DMax를 적용하면 MBD-LLaDA2-Mini-DMax의 평균 TPF는 9.34(+47.1% over SingleBD)에 도달하며, 정확도 하락은 1.02 percentage point에 불과하다.
2 사전 지식
Diffusion language model은 마스킹된 시퀀스를 반복적으로 denoising해 텍스트를 생성하고, block diffusion model은 블록 내부에서 이 과정을 autoregressive하게 수행해 KV caching을 가능하게 한다. 기존 Teacher Forcing과 D2F 학습 방식은 MultiBD inference 상태와 완전히 일치하지 않으며, native D2F는 BD-LM의 prefix caching과 호환되지 않는다.
- Diffusion Language Model: DLM은 생성을 반복적 denoising으로 정식화한다. 토큰을 독립적으로 마스킹하고, 모델은 마스킹된 위치에서 clean 값을 예측하며, inference에서는 높은 confidence의 마스크부터 점진적으로 채운다.학습에서는 마스킹된 토큰에 대해서만 weighted masked-token cross-entropy를 계산한다.
- Block Diffusion Language Model: BD-LM은 시퀀스를 블록으로 분할하고 이를 autoregressive하게 모델링하며, block-causal attention을 사용해 SingleBD decoding에서 KV cache를 재사용할 수 있게 한다.각 블록은 DLM 과정으로 decoding되며 자기 자신과 앞선 블록을 attend한다.
- Teacher Forcing: Teacher Forcing은 현재 블록만 corrupt하고 clean prefix 블록으로부터 이를 예측하므로, MultiBD inference와 개념적으로 호환되지 않는 상태를 학습한다.이 불일치는 MultiBD가 clean prefix에 조건화된 noisy 블록 하나가 아니라 여러 noisy 블록을 동시에 decoding하기 때문에 발생한다.
- Discrete diffusion forcing: D2F는 순서가 있는 noise ratio를 갖는 여러 noisy suffix 블록에 모델을 노출하지만, 학습 상태는 여전히 MultiBD inference와 다르고 native arbitrary-length clean prefix는 직접적인 prefix-cache 재사용을 막는다.Native D2F는 clean prefix에 full attention을 사용한다. cache와 호환되는 block-causal attention을 강제하면 quality degradation이 더 커지므로 MultiTF가 필요하다.
3 방법론
MBD-LMs는 제한된 이질적 noise-groups에서 BD-LMs를 post-training하여 학습을 MultiBD 추론에 맞추고, Block Buffer 실행은 cache 재사용을 보존하며 static-shape 병렬 디코딩을 가능하게 한다.
- Multi-Block Diffusion: MultiBD는 연속된 block의 bounded running-set을 동시에 디코딩하면서 이전 block을 KV cache 내 clean prefix로 유지한다.각 running-set은 active noisy block과 caching을 기다리는 completed block으로 구성되며, slot별 mask ratio가 각 block의 상태를 나타낸다.
- Multi-Block Diffusion: running-set 정식화는 기존 regime을 통합한다. SingleBD는 |Rs| = 1인 경우이며, monotonic scheduler를 사용하는 확장된 running-set은 block-causal D2F training state와 유사하다.이 관계는 training-state 구성에만 해당한다. D2F는 여전히 training paradigm이고 MultiBD는 inference regime이다.
- Multi-Block Teacher Forcing: MultiTF는 MultiBD의 bounded running-set 구조와 이질적인 slot별 noise pattern에 부합하는 inference-like noise-group을 사용해 BD-LMs를 post-training한다.뒤의 noise-group은 앞선 clean group을 조건으로 하며, 하나의 noisy block에서 bounded consecutive group으로 teacher forcing을 확장한다.
- Multi-Block Teacher Forcing: MultiTF는 가능한 MultiBD running-set에 대응하는 bounded group size와 서로 다른 group-relative position을 포괄하도록 systematic and random group-layout을 구성한다.최대 training group size는 Gmax이며, systematic shift는 구조화된 coverage를 제공하고 random layout은 layout diversity를 높인다.
- Static-Shape MultiBD Execution: Block Buffer는 논리적 running-set과 물리적 input을 분리하여, 처리되는 token 수가 변하더라도 CUDA Graph replay를 위한 static shape을 제공한다.이 메커니즘은 inter-block parallelism을 보존하고, 디코딩과 KV-cache 저장을 겹치며, prefix-cache 재사용을 유지한다.
4 실험
실험 결과, MultiTF는 정확도를 유지하거나 향상하면서 BD-LM을 훨씬 높은 decoding parallelism을 갖는 MBD-LM으로 변환한다. 학습이 제한된 이질적 MultiBD inference state와 일치할 때, 이러한 이득은 DMax 적용 여부, backbone, wall-clock throughput 전반에서 지속된다.
- 주요 분석: MBD-LLaDA2-Mini는 native SingleBD 대비 평균 TPF를 3.47에서 6.19로 (+78.4%), 평균 accuracy를 79.95%에서 81.03%로 높인다.DMax 없이도 TPF는 SingleBD에서의 LLaDA2-Mini-DMax와 비슷하고 (6.19 vs. 6.35), accuracy는 더 높다 (81.03% vs. 79.59%).
- T2T-enhanced decoding과의 호환성: MultiTF를 DMax와 결합하면 평균 TPF가 6.35에서 9.34로 (+47.1%) 증가하며, 평균 accuracy는 1.02 percentage-point만 하락한다.이는 MBD-LM이 Token-to-Token-enhanced decoding과 결합될 수 있음을 보여준다.
- train–inference alignment의 효과: training-free MultiBD는 TPF를 높일 수 있지만 accuracy를 낮출 수 있으므로 MultiTF alignment가 필요하다. 또한 reliable inference에는 제한된 active set과 slot별 이질적 noise pattern이 요구된다.MultiBD는 일반적으로 약 두 개의 active block을 유지하며, 때때로 세 개 또는 네 개로 확장된다. MultiTF는 SDAR에도 일반화되어 TPF를 2.54에서 4.46으로, accuracy를 69.00%에서 69.74%로 높인다.
- Ablation study: 전체 MultiTF configuration은 TPF를 6.57에서 9.87로, AUP를 536.89에서 805.34로 높이며, 평균 accuracy는 84.67%에서 84.59%로만 변한다.체계적 noise-group layout과 random noise-group layout을 결합하면 가장 높은 TPF와 AUP를 얻는다. 반면 D2F-style scheduling은 TPF를 8.76으로 높이지만 accuracy를 79.34%로 낮춘다.
- Throughput 분석: MBD는 wall-clock throughput을 향상한다. LLaDA2-Mini는 745.92 Avg. TPS에 도달해 517.16과 비교되며, 이는 TPF와 step latency로부터 예측된 1.44× scaling과 일치한다.TPF는 3.47에서 6.19로 증가하는 반면 step latency는 7.07 ms에서 8.78 ms로 늘어난다. static shape은 resident token과 dummy token을 추가해 token efficiency를 낮춘다.
5 관련 연구
Diffusion language model은 병렬 denoising을 가능하게 하지만 serving에 제약이 있으며, block-causal 변형은 순차적 block 처리라는 비용으로 KV caching과 flexible-length generation을 추가한다. 본 연구는 MultiBD를 별도의 inter-block parallelism regime으로 다루고, bounded하고 heterogeneous한 multi-block state에 맞춰 학습을 정렬하는 MultiTF를 제안한다.
- Diffusion Language Model: DLM은 반복적 denoising과 병렬 token refinement를 통해 텍스트를 생성하지만, 완전한 bidirectional model은 자연스러운 KV caching과 flexible-length generation을 지원하지 못한다.대표적인 model로 LLaDA (Nie et al., 2025), Dream (Ye et al., 2025), LLaDA2.x (Bie et al., 2025, 2026)가 있다.
- Block Diffusion Language Model: BD-LM은 (Arriola et al., 2025; Bie et al., 2025; Cheng et al., 2025) block-causal generation을 사용해 KV caching과 intra-block parallel decoding을 가능하게 한다.SingleBD는 clean cached prefix를 조건으로 하나의 noisy block을 decode하지만, block을 순차적으로 처리하므로 inter-block parallelism을 충분히 활용하지 못한다.
- Multi-Block Diffusion: MultiBD는 연속된 block의 bounded running-set을 동시에 refine하여 BD-LM을 SingleBD의 순차적 block 처리 이상으로 확장한다.running-set은 본 연구에서 다루는 더 넓은 inference regime을 정의한다.
- Efficient Diffusion Language Model: Efficient DLM 연구는 distillation, scheduling, caching, parallel decoding을 탐구하며, D2F의 noisy-block visibility와 accuracy–parallelism trade-off를 다루는 방법을 포함한다.관련 방법으로 D2F (Wang et al., 2025), DMax (Chen et al., 2026), d3LLM (Qian et al., 2026), LightningRL (Hu et al., 2026), dParallel (Chen et al., 2025), Fast-dLLM (Wu et al., 2025), LoPA (Xu et al.)가 있다.
- 본 연구의 포지셔닝: inference-time heuristic이나 token-level parallelism만을 사용하는 것과 달리, 본 연구는 MultiBD를 목표 regime으로 설정하고 inference와 유사한 multi-block state를 학습하기 위한 MultiTF를 제안한다.이 접근법은 bounded running-set 구조와 heterogeneous한 slot-wise noise pattern을 train–inference alignment factor로 강조하고, post-training을 통해 BD-LM을 MBD-LM으로 변환한다.
6 결론
MBD-LMs는 학습 상태를 bounded running-set 디코딩 및 heterogeneous slot-wise noise와 정렬해 신뢰성 높은 MultiBD 추론을 가능하게 한다. MultiTF와 Block Buffer는 KV caching과 static-shape execution으로 생성 품질을 유지하면서 병렬성과 처리량을 함께 향상한다.
- 6 결론: MBD-LMs는 신뢰성 높은 MultiBD 추론을 위해 BD-LMs를 통합하고, inter-block parallelism으로 SingleBD의 순차적 병목을 해소한다.MultiBD에는 bounded running sets 및 heterogeneous slot-wise noise patterns에 정렬된 학습 상태가 필요하다.
- 6 결론: MultiTF는 bounded noise-groups, Group-Aware Dual-Stream Mask, randomized block-level noise-schedulers를 사용해 BD-LMs를 post-train한다.이 구성 요소들은 기존 학습 상태와 MultiBD 추론 상태 사이의 불일치를 해소한다.
- 6 결론: Block Buffer inference engine은 KV caching과 prefix-cache reuse를 유지하면서 static-shape execution을 가능하게 한다.math 및 code benchmarks 실험에서 생성 품질을 유지하면서 디코딩 병렬성과 실제 처리량이 향상되는 것으로 나타났다.
A MultiTF의 이론적 관점
MultiTF는 이상적인 MultiBD 학습 objective를 직접 보장하는 방식이 아니라 coverage 기반 surrogate다. 근사 오차는 running-set coverage mismatch와 noise-ratio distribution mismatch에 의해 제어된다.
- Objective 해석: MultiTF는 downstream accuracy를 직접 보장하는 것이 아니라 inference-state coverage와 slot-wise noise-ratio distributions를 맞춰 이상적인 MultiBD 학습을 근사한다.이론적 관점에서는 MultiTF를 이러한 distributional mismatches에 따라 gap이 결정되는 surrogate로 명시적으로 규정한다.
- Running-Set Coverage: Systematic shifts는 크기가 2부터 Gmax까지인 모든 연속 running-set을 정확히 한 번씩 cover하고, random layouts는 비정규적인 noise-group-size 조합을 추가한다.각 고정 group size에 대해 shifted layouts는 각 group-relative logical slot에 모든 block을 배치하기도 한다.
- Objective Mismatch Bound: Objective gap은 MδR + Ltδt로 bound되며, δR은 running-set mismatch를, δt는 conditional noise-ratio mismatch를 측정한다.이 bound는 running-set 항의 bounded loss와 conditional 항의 noise ratio에 대한 Lipschitz dependence에서 따른다.
- 시사점: δR과 δt를 줄이면 ideal MultiBD inference와의 gap이 좁혀진다. systematic shifts는 support mismatch를 줄이고, random layouts는 diversity를 추가하며, chain-uniform scheduling은 noise-ratio mismatch를 줄인다.Scheduler는 MultiBD states에 정렬된 heterogeneous slot-wise noise gaps를 생성한다.
B MultiTF 학습 구현 세부사항
이 부록에서는 MultiTF post-training을 자세히 설명하고, 학습 및 추론 용어를 정의하며, 서로 다른 모델 계열에 사용한 프레임워크와 데이터를 명시한다.
- B MultiTF 학습 구현 세부사항: MultiTF는 학습 단계에서 noise-groups, group-layouts, noise-schedulers를 사용하고 추론 단계에서 Block Buffers와 slots를 사용해 BD-LMs를 MBD-LMs로 post-training한다.Gmax는 최대 noise-group 크기, Λ는 group-layout 집합, λ는 하나의 group-layout, Hm은 하나의 noise-group을 뜻한다.
- B MultiTF 학습 구현 세부사항: MultiTF의 학습 프레임워크로 VeOmni (Ma et al., 2025)를 사용한다.
- B MultiTF 학습 구현 세부사항: SDAR 모델은 선행 연구의 reasoning/code 데이터를 사용하는 반면, LLaDA2.x 및 DMax-enhanced 모델은 각 base recipe에 해당하는 mixture를 사용한다.인용한 선행 연구는 Boizard et al. (2025)와 jtatman (2025)다.
B.1 그룹 배치 구성 · B.2 체인 균일 Noise-Scheduler · B.3 그룹 인식 Dual-Stream Mask
MultiTF는 다양한 연속 noise-group 배치를 구성하고, 각 그룹에 monotonic한 randomized mask ratio의 chain-uniform sequence를 할당하며, group-aware dual-stream attention mask를 사용한다. 이 구성요소들은 정보 누출을 방지하면서 MultiBD의 bounded running-set visibility를 근사한다.
- B.1 그룹 배치 구성: MultiTF는 연속 블록을 noise-group으로 분할하며, 그 배치는 가능한 MultiBD running-set과 일치한다.각 group-layout λ=(H1,…,H|λ|)은 블록 sequence를 연속 그룹으로 분할한다.
- B.1 그룹 배치 구성: 체계적인 shifted layout은 고정 길이의 모든 연속 running-set을 경계 효과를 제외하고 모든 group-relative position에 걸쳐 포괄한다.그룹 크기가 g일 때 shift h=(a−1) mod g를 선택하면 각 길이-g running-set {a,…,a+g−1}이 하나의 shifted layout에 배치된다.
- B.1 그룹 배치 구성: Random layout은 체계적 layout의 coverage guarantee를 대체하지 않으면서 비정규적인 group-size 조합과 경계 패턴을 추가한다.Random group은 전체 블록 sequence가 포괄될 때까지 순차적으로 sampling된다.
- B.2 체인 균일 Noise-Scheduler: 각 noise-group에 대해 MultiTF는 낮은 noise range에서 floor를 sampling한 뒤, effective upper bound까지 각 블록의 mask ratio를 재귀적으로 sampling한다.각 sampled ratio는 다음 블록의 floor가 되어 monotonic하지만 randomized된 slot-wise noise level을 만든다.
- B.2 체인 균일 Noise-Scheduler: Chain-uniform scheduler는 fixed-step D2F보다 더 크고 변동성이 높은 block-level noise-ratio gap을 만들어 MultiBD inference 중 heterogeneous active block과 일치시킨다.Noise-transition margin ratio ρ는 ablation에서 사용되는 random scheduler power-law bias γrand와 독립적이다.
- B.3 그룹 인식 Dual-Stream Mask: MultiTF는 noisy sequence와 clean sequence를 연결하고, noisy diagonal, noisy-to-clean offset-causal, clean block-causal component로 구성된 group-aware dual-stream attention mask를 적용한다.이 구성요소들은 각각 MGD, MGOC, MBC로 표기된다.
- B.3 그룹 인식 Dual-Stream Mask: Noisy token은 자신의 noise-group 내부와 동일하거나 앞선 블록에만 attend하고, 그룹은 이전 clean prefix를 조건으로 하며, clean token은 noisy token에 절대 attend하지 않는다.이는 정보 누출 없이 필요한 visibility pattern을 구현한다.
B.4 MultiTF Objective and Model-specific Training Recipes … B.5 Sorted-uniform Scheduler Baseline
MultiTF는 bounded multi-block training input을 표준화하면서 각 base BD-LM이 model-specific objective 또는 recipe를 유지하도록 한다. 이 framework는 default masked-token CE, DMax self-denoising, SDAR block-wise weighting을 지원하며, sorted-uniform은 monotonic scheduler baseline을 제공한다.
- B.4 MultiTF Objective and Model-specific Training Recipes: MultiTF는 layout λ, noisy sequence xλ_t, clean sequence x0, Group-Aware Dual-Stream Mask Aλ로부터 training state를 구성한다.서로 다른 base BD-LM은 각자의 model-specific training recipe를 유지하면서 이 MultiTF input sequence를 재사용한다.
- B.4.1 Default MultiTF CE Objective: Default MultiTF objective는 standard masked-token CE로 학습된 BD-LM에 대해 noisy portion of Xλ의 masked position에 masked-token cross-entropy를 적용한다.원래 model recipe가 standard masked-token cross-entropy를 사용하는 경우 적용되는 default objective다.
- B.4.2 DMax-enhanced Models: OPUT Self-denoising: OPUT self-denoising procedure는 no-gradient pass에서 argmax로 masked token을 예측하고, 이를 xλ_t에서 대체한 뒤 partially self-denoised sequence를 반환한다.이 sequence는 이후 self-denoising loss branch의 input으로 사용된다.
- B.4.2 DMax-enhanced Models: OPUT Self-denoising: DMax-enhanced model은 MultiTF input을 재사용하고, original noisy branch와 함께 partially self-denoised noisy sequence로 학습하는 OPUT branch를 추가한다.Self-denoising branch는 no-gradient forward pass를 수행하고 masked position을 argmax prediction으로 대체한 뒤 loss를 계산한다. Gradient는 이후 loss computation을 통해서만 흐른다.
- B.4.3 SDAR Models: Block-wise Noise-weighted CE: SDAR model은 MultiTF input과 Group-Aware Dual-Stream Mask를 재사용하지만 global masked-token CE를 block-wise noise-weighted CE로 대체한다.각 block의 loss는 해당 block의 mask ratio로 normalize되며, SDAR의 per-block weighting을 유지하면서 diffusion loss를 전체 block sequence로 확장한다.
- B.4.3 SDAR Models: Block-wise Noise-weighted CE: SDAR의 block-wise normalization은 noisy portion의 모든 masked position에 대해 global하게 normalize하는 Equation B.11과 다르다.작은 상수 ϵ은 block-wise objective의 numerical stability를 제공한다.
- B.5 Sorted-uniform Scheduler Baseline: sorted-uniform scheduler는 각 noise-group 내에서 mask ratio를 독립적으로 uniform sampling하고, 이를 ascending order로 정렬한 뒤 block에 할당하여 monotonic block-level noise를 생성한다.chain-uniform scheduler와 달리 인접 slot 사이의 gap은 uniform order statistics에서만 발생하며, 크게 만들도록 명시적으로 유도되지 않는다.
C MultiBD 추론 구현 세부사항 … C.4 임계값이 활성화와 토큰 업데이트를 제어한다.
부록에서는 동적 running-set 상태를 표현하면서 prefix KV-cache 재사용과 정적 tensor shape을 유지하는 고정 크기 Block Buffer로 MultiBD를 구현한다. 별도의 임계값이 block 활성화, context 공유, 토큰 업데이트를 조정해 동시 refinement를 안정화한다.
- C MultiBD 추론 구현 세부사항: 최적화된 MultiBD 알고리즘은 정적 physical input shape으로 running-set을 실행하면서 prefix KV-cache 재사용을 유지한다.이 설계는 cached prefix 표현을 변경하지 않고 concurrent block decoding을 실용적으로 실행하는 것을 목표로 한다.
- C.1 dynamic running-set은 static-shape 실행을 방해한다.: 직접적인 dynamic running-set은 future block을 추가하고 완료된 block을 제거하지만, active-token 수가 바뀌어 step과 request 전반에서 일관된 execution shape을 유지할 수 없다.이 절차는 여전히 inter-block parallelism을 제공하지만, variable input size가 효율적인 실행을 어렵게 만든다.
- C.2 고정된 Block Buffer가 MultiBD 상태를 구현한다.: 고정된 Block Buffer는 Nbuf physical slots을 사용해 future block에 dummy slots을 활성화하고, CUDA Graph capture와 replay를 위해 정적 tensor shape을 유지한다.앞쪽의 완료된 block은 prefix KV cache에 commit되고, physical input sequence를 확장하지 않은 채 논리적으로 제거된다.
- C.2 고정된 Block Buffer가 MultiBD 상태를 구현한다.: Figure 6은 fully block-causal D2F가 cache compatibility를 높이지만 accuracy를 크게 저하시킴을 보여주며, 이는 최적화된 static-shape 설계를 뒷받침한다.이 figure는 fully block-causal D2F에서 cache compatibility와 accuracy를 대조한다.
- C.3 Block state가 고정된 Block Buffer를 진행시킨다.: Block Buffer slot은 dummy, active, to-cache, in-cache states 사이를 전이하며, physical input shape을 변경하지 않고 논리적 running-set의 진화를 재현한다.Dummy slot은 capacity를 예약하고, active slot은 forward pass에 참여하며, to-cache block은 commit을 기다리고, in-cache block은 active running-set을 벗어난다.
- C.4 Threshold가 activation과 token update를 제어한다.: 별도의 threshold가 고정된 Block Buffer 내에서 block activation, stability, semi-completion context sharing, M2T/T2T token update를 제어한다.τadd와 τstable은 future-block activation을 제한하고, τsemi은 full caching 전에 top-1 preceding-block context를 활성화하며, 선택적 τT2T와 함께 τM2T가 update를 제어한다.
- C.4 Threshold가 activation과 token update를 제어한다.: 별도의 M2T와 T2T threshold는 concurrent refinement를 안정화한다. M2T는 새로운 content를 추가하는 반면, T2T는 commit 전에 tentative content를 덮어쓴다.이 구분은 서로 다른 update reliability profile에 threshold를 맞춰 running-set 전반의 error propagation을 줄인다.
C.5 Prefix Caching과 Fully Block-Causal D2F
Fully block-causal D2F는 prefix caching과의 호환성을 높이지만 정확도를 크게 낮추므로, attention을 단순히 제한하는 것만으로는 cache 호환성을 달성할 수 없음을 보여준다. 반면 Block Buffer MultiBD는 변경 불가능한 cached prefix를 유지하면서 active block을 병렬로 정제한다.
- Prefix caching: Native D2F는 noisy prefix block이 SingleBD와 달리 변경 불가능한 causal prefix page로 구성되지 않기 때문에 prefix-cache 재사용을 깨뜨린다.SingleBD는 현재 noisy block만 재계산하고, 완료된 clean block의 cached KV state는 재사용한다.
- Fully block-causal D2F: Fully block-causal variant는 임의의 token-level prefix를 block 경계까지 완성하고, 경계 block을 첫 번째 noisy suffix block으로 취급하며, masked suffix position에 대해서만 loss를 계산한다.경계 block은 prefix position을 clean 상태로 유지하고 suffix position만 noise 처리하며, 이후 block은 완전히 suffix-noise 처리된다.
- Fully block-causal D2F: 77.60% to 69.60%: fully block-causal D2F는 prefix-full D2F보다 정확도를 크게 낮추므로, 단순한 attention-mask 제한이 아니라 MultiTF가 필요함을 뒷받침한다.이 결과는 D2F가 더 강한 prefix-full visibility의 이점을 얻는다는 것을 보여준다.
- Block Buffer MultiBD: Block Buffer MultiBD는 committed block을 변경 불가능한 cached context로 만들어 prefix caching을 유지하고, active block을 재계산하며, 향후 dummy slot은 활성화될 때까지 보이지 않게 한다.이를 통해 cached prefix block과 active Block Buffer slot을 분리하고, 병렬 정제 중 prefix KV 재사용을 가능하게 한다.
D 실험 세부사항
이 부록은 실험에 사용한 추론 관례와 MultiTF post-training hyperparameter를 명시한다. 보고된 설정과 ablation에 사용한 model variant 및 scheduler parameter를 정의한다.
- D 실험 세부사항: SingleBD (Native)는 각 BD-LM의 기존 single-block inference를 의미하며, MultiBD (training-free)는 post-training을 적용하지 않은 경우를, MBD-*는 이에 대응하는 MultiTF-post-trained model을 의미한다.표기법은 native inference, training-free MultiBD inference, MultiTF-post-trained variant를 구분한다.
- D 실험 세부사항: Table 5는 MultiTF post-training hyperparameter를 보고하며, “—”는 해당되지 않는 parameter를 나타낸다.이 표는 MultiTF post-training에 사용한 configuration을 제시한다.
- D 실험 세부사항: t_low와 t_high는 mask-ratio 범위를 정의하고, ρ는 유효 상한 t_eff를 결정하며, N_rand는 sample당 random group-layout의 수를 센다.이 parameter들은 MultiTF scheduler 및 grouping configuration을 규정한다.
- D 실험 세부사항: random-scheduler ablation은 독립적인 power-law bias γ_rand를 사용하며 ρ 또는 chain-uniform scheduler를 사용하지 않는다.따라서 γ_rand는 margin-ratio parameter 및 chain-uniform scheduling과 별개다.