Source-linked AI summary

ABACUS: Adapting Unified Foundation Model for Bridging Image Count Understanding and Generation

Anindya Mondal, Sauradip Nag, Anjan Dutta

arXiv:2606.23835v1cs.CVeess.IV

TL;DR

기존 접근법은 task-specific pipeline과 제한적인 spatial grounding에 의존하기 때문에 unified model이 fine-grained counting과 generation을 함께 지원하기 어렵다. ABACUS는 spatially grounded counting, boundary-aware optimization, cycle-consistent self-reward로 이를 해결하며, 하나의 3B-parameter model로 7개 benchmark에서 state-of-the-art 성능을 달성한다.

  • 문제

    기존 unified vision-language model은 fine-grained instance-level counting과 visual understanding 및 generation의 joint bridging에 어려움을 겪는다.

  • 방법

    ABACUS는 density-aware adaptive zooming, attention-derived objectness map, boundary-aware GRPO, cycle-consistent self-reward를 하나의 unified model로 결합한다.

  • 결과

    ABACUS는 counting, count-faithful generation, count reasoning을 아우르는 7개 benchmark에서 state-of-the-art 결과를 달성하며, specialist model과 더 큰 generalist model을 능가한다.

  • 시사점 및 한계

    결과는 spatial awareness를 위해 count understanding과 generation을 상호 강화하는 objective로 공동 최적화하는 방식을 뒷받침한다.

  • 시사점 및 한계

    ABACUS의 현재 count-balanced training mixture는 medical cell counting, satellite vehicle, industrial defect와 같은 specialized domain을 다루지 않는다.

Abstract

from arXiv · show

ABACUS is a unified vision-language model that handles object counting, crowd counting, referring-expression counting, and count-faithful image generation without any benchmark-specific training required. Our model is built on existing 3B-parameter unified foundation model and is adapted for object localization tasks using three key innovations: density-aware adaptive zooming with objectness maps for spatial grounding; a boundary-aware count policy via GRPO to eliminate crop-boundary errors; and a cycle-consistent GRPO strategy where the understanding branch self-critiques generated outputs, closing the understanding-generation gap without any external annotations. ABACUS achieves state-of-the-art results across seven benchmarks, outperforming both task-specific specialists and larger generalist models.

1. 서론

ABACUS는 하나의 zero-shot vision-language model에서 object counting, crowd counting, referring-expression counting과 count-faithful image generation을 통합한다. adaptive spatial grounding, boundary-aware counting, cycle-consistent reinforcement learning을 통해 이해와 생성 사이에 지속되어 온 synergy gap을 해소한다.

  • 동기: 기존 counting 및 count-conditioned generation 방법은 task-specific architecture, loss, training pipeline을 사용하는 반면, unified model은 여전히 이해와 생성 사이의 synergy gap을 보인다 [5].Model은 사과 네 개를 정확히 셀 수 있어도 정확히 네 개를 생성하지 못할 수 있으며, dense-scene counting도 여전히 불안정하다 [61].
  • ABACUS: ABACUS는 하나의 unified model에서 object counting, crowd counting, referring-expression counting, count-faithful image generation을 공동 수행하며 zero-shot generalization을 달성한다.이는 benchmark-specific training 없이 이러한 counting 및 generation task를 포괄하는 최초의 unified VLM으로 제시된다.
  • 방법: Density-aware adaptive zooming은 MLLM attention에서 도출한 objectness map을 사용해 dense image를 관리 가능한 영역으로 재귀적으로 분할하고, spatially grounded counting을 수행한다.이 방법은 기성 MLLM이 dense visual scene을 해석하는 데 겪는 문서화된 어려움을 해결한다 [61].
  • 방법: GRPO를 통한 boundary-aware count policy는 crop boundary에서 발생하는 overcounting 및 undercounting artifact를 제거하며, cycle-consistent GRPO는 frozen understanding branch를 사용해 generated image를 평가한다.Count-deviation reward와 aesthetic reward는 generation branch만 업데이트하여, external annotation 없이 understanding–generation gap을 해소한다.
  • 결과: ABACUS는 object counting, crowd counting, referring-expression counting, count-faithful generation을 아우르는 seven benchmarks 전반에서 새로운 state of the art를 달성한다.기여 요약은 이 네 가지 evaluation area 전반을 포괄한다고 명시적으로 보고한다.

2. 관련 연구

기존 연구는 클래스별 및 클래스 비종속 counting, 멀티모달 vision-language models, counting-aware image generation을 아우르지만, 기존 generation pipeline은 counting을 synthesis와 분리해 다룬다. 반면 ABACUS는 external critic이나 annotation 없이 하나의 모델 안에서 generation, counting, verification을 통합한다.

  • Counting 방법: Counting 방법에는 고정된 범주를 대상으로 하는 클래스별 predictor와 visual exemplar 또는 text prompt의 안내를 받는 클래스 비종속 접근법이 있으며, 대부분 dense point-level supervision을 요구한다.클래스별 방법은 persons, vehicles, cells를 포함한 범주에 detection 또는 density-map regression을 사용한다 [30] [64] [69] [54] [43] [46] [39].
  • Count-faithful generation: Text-to-image diffusion model은 count-conditioned benchmark에서 정확히 일치하는 비율이 25–28%에 불과하며, 기존 방법은 loss, denoising-loop head 또는 cross-attention 조작을 통해 external counting signal을 추가한다.이러한 접근법에서는 counting module이 generator와 구조적으로 분리되어 있다 [57] [14].
  • 통합 generation 및 verification: 최근 system은 반복적 수정을 위해 external VLM critic을 사용하지만, ABACUS는 generator, counter, verifier를 통합하여 external critic, planner 또는 annotation 없이 understanding이 generation을 직접 보상하도록 한다.Critic 기반 수정의 한계는 critic의 신뢰성에 의존한다는 점이다 [53].
  • Vision-language model: CLIP [63]과 BLIP [40] 같은 초기 VLM은 contrastive pretraining을 통해 vision과 text를 정렬했으며, 이후의 MLLM [7] [38]은 downstream task를 위한 reasoning과 generation을 강화했다.관련 연구에서는 text prompt로 지정 가능한 object counting을 위해 VLM을 적용하기도 했다 [33] [61].

3. 사전 지식

ABACUS는 이해와 생성을 위한 통합 post-training 메커니즘으로 Group Relative Policy Optimisation (GRPO)을 사용한다. GRPO는 value network 없이 rollout-relative advantage를 계산하고, frozen reference policy에 대한 정규화를 통해 policy update를 제어한다.

  • Density-aware adaptive zooming: GRPO는 ABACUS의 이해 및 생성 branch 모두에서 통합 post-training 메커니즘으로 기능한다 [68].
  • Group Relative Policy Optimisation: GRPO는 policy rollout 그룹에 대해 상대적으로 advantage를 계산하여 PPO의 value network를 제거하고, 메모리 및 연산 오버헤드를 줄인다.
  • Group Relative Policy Optimisation: policy는 frozen reference policy에 대한 KL penalty를 포함한 surrogate objective를 최대화하며, 정규화 강도는 β > 0으로 제어된다.
  • Density-aware adaptive zooming: Density-aware adaptive zooming은 dense region을 해상도 γ에 도달할 때까지 2×2 sub-region으로 재귀적으로 분할하고, sparse region은 aggregation 전에 한 번만 처리한다.

4. 방법

ABACUS는 하나의 unified vision-language model에 count-accurate image generation과 정밀한 object understanding을 결합한다. 이 방법은 density-aware zooming, objectness-guided localization, boundary-aware GRPO counting, cycle-consistent generation training을 결합한다.

  • Framework 개요: ABACUS는 하나의 unified VLM으로 count-accurate image generation과 정밀한 object counting을 모두 수행한다.이 framework는 별도의 모델을 사용하는 대신 unified count understanding과 generation을 목표로 한다.
  • Density-aware Adaptive Zooming: Density-aware adaptive zooming은 dense image를 더 희소한 영역으로 재귀적으로 분할하고, 각 영역의 local count를 집계해 global count를 산출한다.각 sub-image를 독립적으로 질의하므로 local object density가 낮은 영역에서 신뢰도가 향상된다.
  • MLLM에 Objectness 주입: Language model attention에서 추출한 Objectness maps는 object localization을 위한 spatial evidence를 제공하고, counting이 instance-aware reasoning을 향하도록 유도한다.Per-head isolation과 learned affine alignment로 object peak를 식별하며, Gaussian-smoothed point supervision이 predicted map을 regularize한다.
  • Boundary-Aware Count Policy: Boundary-aware GRPO는 object를 interior, edge, boundary로 분류하고 일관된 quadrant count를 학습해 adaptive zooming에서 crop-line 이중 집계를 방지한다.Crop line 위에 정확히 놓인 object는 하나의 quadrant에 무작위로 할당하며, nested reward가 local 및 global consistency를 강제한다.
  • Understanding을 통한 Generation: Cycle-consistent GRPO는 counter를 고정한 채 understanding branch의 count deviation과 aesthetic quality를 결합한 reward로 generation을 학습한다.generation branch의 LoRA만 업데이트해 reward hacking과 generated count를 평가하는 branch의 손상을 방지한다.
  • Training Strategy: Training은 다음 단계로 진행된다: objectness regularization을 적용한 LoRA 기반 understanding finetuning, curated sample에 대한 GRPO post-training, 이후의 connector training이다.첫 단계에서는 2M개의 densely annotated image와 50K개의 curated sample을 사용하며, understanding training 동안 connector와 generation branch는 frozen 상태로 유지된다.

5. 실험

ABACUS는 object counting, crowd counting, referring-expression counting, count-faithful generation 전반에서 강력한 통합 성능을 보이며, benchmark-specific training 없이 specialist 및 더 큰 unified model을 능가한다. Ablation 결과 이러한 성능 향상은 objectness-guided adaptive zooming, boundary-aware counting, cycle-consistent GRPO에서 비롯됨을 확인했다.

  • Object 및 Crowd Counting: ABACUS는 FSC-147, CARPK, ShanghaiTech 전반에서 specialist 및 VLM counter를 능가하며, ShanghaiTech-A/B에서 CountGD++의 116.0/28.0 대비 78.59/14.75 MAE를 기록한다.FSC-147에서 validation 5.71 및 test 5.03 MAE, CARPK에서 8.41 MAE를 달성하며, FSC-147과 CARPK에서 UniLIP-3B 대비 각각 5× 및 3× 향상된다.
  • Referring Expression Counting: REC-8K에서 text-only ABACUS는 MAE 7.67 및 RMSE 15.84를 달성해 fine-tuned GDINO를 능가하고 GrREC와 대등한 성능을 보이며, RMSE를 19.79에서 낮춘다.평가는 architectural modification이나 benchmark-specific training 없이 3,153쌍을 대상으로 수행된다.
  • 정성적 비교: 정성적 비교에서 ABACUS는 다양한 density regime에 걸쳐 ground-truth count를 추적하며, 자연스러운 spatial arrangement와 함께 exact or near-exact counts를 생성한다.Baseline은 dense scene overcounting, out-of-distribution failure, systematic undercounting, overcounting, rigid layout 또는 mode collapse를 보인다.
  • Ablation Study: Objectness regularization을 제거하면 ablation 성능이 가장 크게 저하되어 MAE가 3.92 증가하고, overlap-heavy/light MAE gap이 2.31에서 6.18로 확대된다.Density-aware adaptive zooming은 dense scene에서 single-pass failure와 tile boundary에서의 fixed-grid double-counting을 방지하면서도 single-pass inference의 1.2× 이내 연산량을 유지한다.
  • Ablation Study: Cycle-consistent GRPO는 understanding과 generation의 co-adaptation을 통해 CoCoCount exact-match를 SFT의 45% 및 open-loop GRPO의 17-point improvement를 넘어 추가로 9 points 향상한다.이 cycle은 이미지를 생성하고, 자체 count를 산출하며, prompt와 count를 비교한 뒤, 점차 더 informative한 reward를 사용해 generation을 업데이트한다.

6. 한계와 향후 연구

ABACUS는 patch 기반 spatial token이 개별 객체를 식별하지 못하기 때문에 저해상도 또는 심하게 압축된 이미지에서 성능이 저하된다. 그러나 단일 3B-parameter 모델로도 서로 다른 7개 benchmark에서 state-of-the-art 성능을 달성한다. 저하된 환경으로 방법을 확장하기 위해 Super-resolution 전처리가 제안된다.

  • 저해상도 및 저하된 입력: ABACUS의 counting pipeline은 충분한 해상도를 필요로 한다. InternViT의 14×14 patch encoding이 저하된 이미지에서 개별 instance를 구분하지 못할 수 있기 때문이다.visual token이 objectness map이 개별 객체를 식별하기에 지나치게 거칠 때 이러한 한계가 발생한다.
  • 저해상도 및 저하된 입력: Super-resolution 전처리를 적용하면 ABACUS를 저해상도 및 심하게 압축된 환경으로 확장할 수 있다.
  • 단일 모델의 범용성 대 domain adaptation: 단일 3B-parameter ABACUS 모델은 다양한 visual domain을 아우르는 7개 benchmark에서 state-of-the-art 성능을 달성한다.

7. 결론

ABACUS는 하나의 architecture에서 count-aware image understanding과 count-faithful generation을 통합하며, spatial grounding, boundary-aware counting, cycle-consistent self-reward를 사용한다. 결론은 understanding과 generation을 공동 최적화하면 상호 강화되는 spatial awareness가 형성된다고 주장한다.

  • 결론: ABACUS는 단일 architecture에서 count-aware image understanding과 count-faithful generation을 통합하며, objectness 기반 spatial grounding, boundary-aware GRPO counting, cycle-consistent self-reward를 결합한다.objectness map은 MHSA head decomposition과 point supervision을 사용하고, boundary-aware policy는 nested rewards를 사용하며, cycle-consistent self-reward는 understanding과 generation을 연결한다.
  • 결론: count understanding과 generation을 공동 최적화하면 어느 한 specialist도 단독으로 달성할 수 없는 emergent spatial awareness가 나타나며, 이는 cycle-consistent self-reward를 counting 너머로 확장하도록 동기를 부여한다.제안된 확장은 동일한 model이 출력을 생성하고 검증하는 다른 spatial reasoning task를 대상으로 한다.
  • Count understanding gallery: ABACUS는 text-only prompt를 사용해 FSC-147, CARPK, ShanghaiTech의 sparse 및 dense scene에서 exact 또는 near-exact counts를 얻는다.이 gallery는 다양한 category와 count range에 걸쳐 1부터 261까지의 count를 포함한다.
  • Count generation gallery: ABACUS는 다양한 prompt에서 요청된 exact count의 image를 생성하면서 naturalistic spatial arrangement와 높은 aesthetic quality를 유지한다.이 gallery는 다양한 prompt에 걸친 count-faithful generation을 보여준다.

A. 추가 Ablations · A.1. Counting Readout: Autoregressive vs. Objectness Peak

부록에서는 본 논문의 FSC-147 validation protocol을 사용해 counting readout과 boundary-aware count policy를 ablation한다. Counting readout에 대해서는 ABACUS가 동일한 모델에서 추가 parameter나 training 없이 autoregressive text generation과 direct objectness-peak counting을 비교한다.

  • A. 추가 Ablations: 별도 표기가 없는 한, ablation은 main ABACUS training setup에서 FSC-147 validation MAE/RMSE를 사용한다.각 variant는 main model과 동일한 LoRA adapter, training data, hyperparameters를 공유한다.
  • A. 추가 Ablations: 부록에서는 두 가지 component-level 선택, 즉 counting readout과 boundary-aware count policy의 decomposition을 평가한다.이 ablation들은 main paper에서 후순위로 남겨 두었다.
  • A.1. Counting Readout: Autoregressive vs. Objectness Peak: ABACUS는 binarised objectness map을 thresholding한 뒤 connected component를 세거나, count를 text token으로 생성해 object를 센다.전자는 objectness-peak readout이고 후자는 autoregressive 방식이다.
  • A.1. Counting Readout: Autoregressive vs. Objectness Peak: Autoregressive readout은 ABACUS의 기본 counting method다.
  • A.1. Counting Readout: Autoregressive vs. Objectness Peak: 두 readout은 Tab. 8에서 동일한 model을 사용해 비교되며, additional parameter나 training은 없다.
  • A.1. Counting Readout: Autoregressive vs. Objectness Peak: Objectness-peak counting은 ≥50 ground-truth object를 포함하는 dense image에서 경쟁력 있는 성능을 보인다.제공된 문단은 이 dense-image regime을 명시하지만 해당 metric 값은 제시하지 않는다.

A.2. 경계 인지형 카운트 정책: 보상 분해

경계 인지형 카운트 정책은 GRPO 보상 shaping을 사용해 사분면 경계에서의 이중 카운팅과 객체 누락을 해결한다. Ablation 결과, 조밀한 이미지에서는 reinforcement learning과 경계 조정이 특히 중요하다.

  • 보상 분해: 분할된 객체의 소유권을 조정하는 보상을 제거하면 성능이 가장 크게 저하되어 MAE가 1.57 증가한다.이 조정은 사분면 경계를 가로지르는 객체가 이중 카운팅되거나 누락되는 것을 방지한다.
  • 보상 분해: GRPO가 없으면 SFT-only training에서 MAE가 2.48 증가해 reinforcement-learning 보상 shaping이 필요함을 확인할 수 있다.이 정책은 사분면별 local accuracy(∆q)를 포함해 학습을 중첩된 보상들로 분해한다.
  • 보상 분해: 일관된 집계를 강제하는 보상을 제거하면 MAE가 0.64 증가하지만, local quadrant counts는 정확하게 유지된다.dense-activated images에서 경계 정책은 sparse-image 성능을 바꾸지 않으면서 MAE를 3.74 개선한다.

B. 구현 세부사항

ABACUS는 선택적으로 학습 가능한 multimodal architecture를 갖춘 UniLIP-3B에서 구현되며, 대부분의 vision, diffusion, decoding, query component는 frozen 상태로 유지된다. 학습은 LoRA 기반 adaptation 이후 8× A100 80GB GPU에서 sequential boundary-aware 및 generation GRPO post-training을 수행하는 방식으로 진행된다.

  • Architecture: ABACUS는 UniLIP-3B [74]를 기반으로 하며, multimodal connector를 통해 InternViT [18], Qwen2, SANA, DC-AE [16]를 N=256 learnable queries와 결합한다.cross-modal projector와 output head는 joint training되는 반면, visual encoder, diffusion transformer, pixel decoder, query bank는 frozen 상태로 유지된다.
  • Optimization: LoRA는 rank r=32 및 α=64로 Qwen2 attention과 feed-forward projection을 adaptation하며, ∼48M trainable parameters를 추가한다.adapter는 WQ, WK, WV, WO, Wup, Wdown projection에 적용된다.
  • Optimization: 학습에는 2K-step warmup, 2×10−5에서 2×10−6까지의 cosine decay, norm-1.0 clipping, 그리고 sequential 2K-step boundary-aware 및 5K-step generation GRPO가 사용된다.모델은 8× A100 80GB GPU에서 bfloat16 mixed precision으로 ∼44시간 동안 학습된다.

C. 인간 평가

인간 평가는 30명의 annotator와 60개의 층화 프롬프트를 사용해 생성 이미지의 count accuracy, 미적 품질, 프롬프트 정합성, 전반적 선호도를 평가한다. 7개 방법을 비교하며, 통합된 미적 품질·정합성·선호도 점수는 Table 10에 보고한다.

  • 평가 설정: 인간 평가는 전체 count 범위를 아우르는 CoCoCount, T2I-CompBench, GenEval의 30명의 annotator와 60개의 층화 프롬프트를 사용한다.프롬프트 세트는 CoCoCount 프롬프트 25개, T2I-CompBench counting 프롬프트 25개, GenEval 프롬프트 10개로 구성된다.
  • 비교 및 보고: 7개 방법을 비교하며, 적용 가능한 프롬프트 그룹 전체에서 점수를 평균하고 20% random baseline을 기준으로 preference win rate를 측정한다.T2I-CompBench에서는 open-vocabulary 설정에 YOLOv9 detection을 적용할 수 없으므로 human score만 보고한다.
  • 평가 기준: 이미지는 0–4 Likert scale을 사용해 Count Accuracy, Aesthetic Quality, Prompt Alignment를 평가하며, 전반적 선호도 판단도 함께 수집한다.Count Accuracy는 정확한 수량을 측정하고, Aesthetic Quality는 시각적 완성도를 평가하며, Prompt Alignment는 object count를 제외한 텍스트 충실도를 측정한다.
  • 비교 및 보고: Table 10은 Aesthetic Quality, Prompt Alignment, Overall Preference 결과를 통합하며, Likert 점수는 0–100으로 정규화한다.Preference는 win rate percentage로 보고하고, Count Accuracy는 본문에 보고한다.
Loading 2606.23835v1…