Source-linked AI summary

SketchVLM: Vision language models can annotate images to explain thoughts and guide users

Brandon Collins, Logan Bolton, Hung Huy Nguyen, Mohammad Reza Taesiri, Trung Bui, Anh Totti Nguyen

arXiv:2604.22875v2cs.CVcs.AI

TL;DR

최신 VLM은 대개 이미지 질문에 텍스트로 답하므로 검증이 어려울 수 있다. SketchVLM은 대신 편집 가능한 비파괴적 SVG 오버레이를 생성하며, 정확도에서 +28.5 percentage points, annotation quality에서 +48.3%로 sketching models를 능가한다.

  • 문제

    최신 VLM은 대개 이미지 질문에 텍스트로 답하므로 사용자가 검증하기 어려울 수 있다.

  • 방법

    SketchVLM은 task-specific training 없이 원본 이미지에 기반한 구조화된 stroke를 생성하도록 VLM에 프롬프트를 제공하고, 이를 편집 가능한 비파괴적 SVG 오버레이로 변환한다.

  • 결과

    평가한 과제 전반에서 sketching models 대비 정확도는 +28.5 percentage points, annotation quality는 +48.3% 향상된다.

  • 시사점 및 한계

    이러한 시각적 설명을 통해 사용자는 텍스트만 제공하는 응답이나 image-editing baselines와 달리 모델의 추론을 한눈에 검증할 수 있다.

  • 시사점 및 한계

    SketchVLM은 Qwen2.5-VL-7B [3]처럼 instruction following에 어려움을 겪는 small VLM에서는 성능이 좋지 않다.

Abstract

from arXiv · show

When answering questions about images, humans naturally point, label, and draw to explain their reasoning. In contrast, modern vision-language models (VLMs) such as Gemini-3-Pro and GPT-5 only respond with text, which can be difficult for users to verify. We present SketchVLM, a training-free, model-agnostic framework that enables VLMs to produce non-destructive, editable SVG overlays on the input image to visually explain their answers. Across seven benchmarks spanning visual reasoning (maze navigation, ball-drop trajectory prediction, and object counting) and drawing (part labeling, connecting-the-dots, and drawing shapes around objects), SketchVLM improves visual reasoning task accuracy by up to +28.5 percentage points and annotation quality by up to 1.48x relative to image-editing and fine-tuned sketching baselines, while also producing annotations that are more faithful to the model's stated answer. We find that single-turn generation already achieves strong accuracy and annotation quality, and multi-turn generation opens up further opportunities for human-AI collaboration. An interactive demo and code are at https://sketchvlm.github.io/.

1 서론

SketchVLM은 원본 이미지에 기반한 별도의 overlay layer에 편집 가능한 SVG annotation을 생성해, 텍스트만 제공되는 VLM 답변을 검증하기 어려운 문제를 해결한다. 7개의 drawing 및 visual-reasoning task에서 원본 이미지를 보존하고 single-turn 및 multi-turn interaction을 지원하면서 generalizability, accuracy, annotation quality를 향상한다.

  • 동기와 접근법: SketchVLM은 이미지를 수정하거나 task-specific training을 요구하지 않고, 원본 이미지에 기반한 별도의 overlay layer에 SVG annotation을 생성한다.이 framework는 Gemini-3-Pro-Preview [30]를 포함한 여러 VLM backbone으로 평가된다.
  • 주요 결과: SketchVLM은 더 정확한 ball-drop trajectory를 그리고, 점들을 더 정확하게 연결하며, 더 그럴듯한 maze-navigation path를 생성하는 반면, Nano Banana는 이미지의 내용을 변경하고 비현실적인 path를 생성하는 경우가 많다.sketching에 fine-tuning된 specialist VLM은 새로운 task로 generalize하지 못하는 경우가 많지만, SketchVLM은 더 뛰어난 generalizability, accuracy, annotation quality를 보인다.
  • 주요 결과: 7개의 task—3개의 drawing task와 4개의 visual-reasoning task—에서 SketchVLM은 specialized fine-tuned sketching model보다 더 generalizable하고 정확하며 품질이 높은 annotation을 생성한다.평가는 connecting-the-dots, object-part labeling, shape drawing, physics understanding, counting, maze navigation을 포함한다.
  • Interaction과 guidance: Single-turn SketchVLM과 multi-turn SketchVLM은 비슷한 accuracy를 달성하지만, single-turn generation이 훨씬 빠르다. 외부 x–y coordinate grid를 추가하면 drawing 및 question-answering accuracy가 향상되지만, 필수적이지는 않다.이 결과는 deployment에서 speed와 coordinate guidance가 실용적인 trade-off임을 보여준다.

2 관련 연구 … 6. VPCT

SketchVLM은 visual prompting, 구조화된 stroke 생성, XML-to-SVG rendering을 통해 기존 vision-language model에 편집 가능한 SVG overlay를 제공한다. 이 논문은 connection, counting, localization, part labeling, maze navigation, visual physics prediction을 포함한 visual reasoning 및 drawing task 전반에서 이 framework를 평가한다.

  • 2 관련 연구: SketchVLM은 image-editing model 및 편집 가능한 정렬 annotation이 없는 native multimodal model과 달리, 최신 VLM이 입력 이미지에 non-destructive SVG overlay를 annotation하도록 한다.이 framework는 native image-editing, interleaved text–image, fine-tuned sketching 접근법과 대비된다.
  • 3 SketchVLM: 이 framework는 visual prompting, 구조화된 stroke output, XML-to-SVG conversion을 결합해 source image 위에 annotation을 rendering한다.좌표 grid가 공간적 정밀도를 지원하며, 두 점으로 이루어진 stroke는 line이 되고 더 긴 stroke는 매끄러운 cubic Bézier curve로 fitting된다.
  • 1. Connect-the-Dots: Connect-the-dots 평가는 무작위로 생성된 pattern, silhouette에서 파생된 puzzle, worksheet 형식 이미지 전반에서 model이 dot을 locate하고 순서대로 connect하도록 요구한다.이 benchmark는 세 subset에 걸친 100 images로 구성된다.
  • 2. Counting Objects: Counting 평가는 object count가 0에서 10까지인 746 images를 사용하며, model이 target object를 세고 각각에 번호가 매겨진 marker를 배치하도록 요구한다.이미지는 CountBench 및 Pixmo-Count에서 가져온다.
  • 3. Drawing Shapes around Objects: Drawing-shape, part-labeling, maze benchmark는 object localization, object part에 text를 배치하는 작업, grid maze에서의 path validity를 평가한다.Localization set은 1,000 COCO images로 구성되며, part labeling은 985 images와 52 object classes를 포함한다. Maze는 최단 경로가 3에서 8 steps까지 다양하고, 유효하지 않게 perturb된 path도 포함한다.
  • 4. Part Labeling: Part labeling은 대응하는 part location에 correct text label을 배치하도록 요구하는 반면, maze navigation은 제안된 path를 tracing하고 벽을 넘지 않으면서 goal에 도달하는지 판단하도록 요구한다.이 task들은 선별된 part annotation과 생성된 3 × 3 grid maze를 사용한다.
  • 6. VPCT: VPCT는 100 hand-crafted images에서 떨어뜨린 공이 어느 landing container에 들어갈지 model이 predict할 수 있는지 평가하며, 동일한 sample에서 single-turn and multi-turn annotation generation을 함께 제시한다.Multi-turn generation에서는 이후 call이 rendering된 image와 text 형식의 이전 annotation을 재사용한다.

7. Ball Drop

Ball Drop benchmark는 SketchVLM이 공의 궤적을 추적하면서 착지 컨테이너를 예측할 수 있는지 평가하고, 기존 visual-annotation 접근법과 single-turn 및 multi-turn annotation을 비교한다. SketchVLM은 경쟁력 있는 정확도를 유지하면서 visual reasoning trace를 생성한다.

  • Benchmark: 이 benchmark는 무작위로 배치된 1개, 2개 또는 3개의 선과 무작위 공 위치가 포함된 198개의 synthetic image로 구성되며, 착지 컨테이너를 선택하고 궤적을 추적해야 한다.Ground-truth 궤적은 PHYRE [4]를 사용해 생성되며, 추측하기 더 어려운 정답과 네 개의 가능한 컨테이너가 주어진다.
  • Evaluation: SketchVLM은 single-turn mode와 multi-turn mode에서 평가되며, multi-turn generation에서는 이전에 렌더링된 annotation과 그 text representation을 사용해 매 turn마다 하나의 stroke를 생성한다.multi-turn 설정에서는 모델이 마지막 turn에 최종 text answer를 제시한다.
  • Metrics: 성능은 task accuracy와 annotation–text alignment를 통해 평가되며, answer correctness와 visual trace가 text answer를 충실하게 뒷받침하는지를 모두 측정한다.평가에서는 informative annotation과 그럴듯하지만 모순되는 annotation을 구분한다.
  • Results: SketchVLM은 Ball Drop task에서 경쟁력 있는 정확도를 유지하면서 visual reasoning trace를 생성한다.Table 2는 이 전반적인 비교를 보고하며, 평가에서는 answer correctness만이 아니라 annotation–text alignment도 고려한다.

5 결과

SketchVLM은 높은 task accuracy를 달성하고 답변과 밀접하게 일치하는 annotation을 생성해 reasoning 및 drawing task 전반에서 시각적 검증을 가능하게 한다. 또한 grid prompting과 single-turn generation의 이점을 보이는 한편, 작은 object와 annotation-quality evaluation의 한계도 드러낸다.

  • Ablations: grid와 sketching prompt를 모두 추가한 설정이 전반적으로 가장 우수하지만, grid는 Connect-the-Dots RMSE를 5.92에서 99.34로 높인다.따라서 보고된 configuration은 Connect-the-Dots를 제외한 task에서 grid를 사용하며, Connect-the-Dots에서는 grid 없이 더 나은 결과를 얻는다.
  • Drawing task: SketchVLM은 최대 35개의 connecting-the-dots point를 5.92 RMSE로 찾아내며, point의 순서를 74% 및 99%의 경우에 올바르게 정렬한다.이 방법은 많은 stroke에 걸쳐 spatial accuracy와 logical coherence를 유지하지만, 다른 model은 point를 순서가 뒤섞인 상태로 연결하는 경우가 많다.
  • Object detection: Stroke-based rectangle은 medium-object 성능을 +0.6, large-object 성능을 +1.4 향상시키지만 small-object detection을 -10.1 낮추며, AP50을 63.1에서 58.8로 감소시킨다.분석에 따르면 이러한 성능 저하는 낮은 recall 때문이며, precision은 original model과 일치한다.
  • Visual reasoning: 96.0% VPCT와 79.7% Ball Drop accuracy는 visual reasoning task에서 SketchVLM의 강력한 성능을 보여준다.보고된 SketchVLM 결과는 비교 대상 model에 대해 제시된 거의 무작위 수준의 baseline accuracy를 크게 상회한다.
  • Alignment 및 annotation quality: 95.5%와 94.2%의 mean alignment score는 SketchVLM annotation이 model의 text answer와 밀접하게 일치함을 보여준다.논문은 이러한 alignment가 model의 reasoning이 타당한지 사용자가 검증할 수 있게 한다고 설명한다.
  • Generation setting: Single-turn generation은 모든 task에서 multi-turn generation과 비슷하거나 더 높은 accuracy를 달성하면서 약 5.92x 더 적은 turn을 사용한다.이는 high-quality annotation을 생성하는 효율적인 설정으로 single-turn generation을 지지한다.

6 결론

SketchVLM은 사용자가 VLM의 추론을 시각적으로 검증하도록 돕는 편집 가능하고 비파괴적인 SVG annotation을 생성하는 training-free framework다. 정확도에서 sketching model보다 우수하고 강력한 open-source VLM으로 전이되지만, 더 작은 model에서는 어려움을 겪으며 편집 가능한 stroke가 도움이 될 수 있다.

  • 결론: SketchVLM은 정확도에서 sketching model보다 +28.5 percentage points 우수하다.이 결과는 Tab. C1에 보고되어 있다.
  • 한계와 향후 연구: SketchVLM은 Kimi K2.5 [44]와 같은 강력한 open-source VLM으로 전이되지만, Qwen2.5-VL-7B [3]와 같은 더 작은 model에서는 성능이 낮다.이러한 한계는 더 작은 VLM의 instruction following 능력이 약하기 때문으로 설명된다.
  • 한계와 향후 연구: model이 stroke를 undo하고 edit하도록 허용하는 것은 multi-turn 성능을 향상하는 잠재적 방법이다.이는 향후 연구 과제로 제안된다.

7 저자 기여 진술

저자들은 benchmark 생성 및 큐레이션, 실험, method 개발, 평가, 논문 작성, demo 및 웹사이트 개발, 프로젝트 감독으로 역할을 나누었다. BC, LB, HN은 dataset과 실험에 주요하게 기여했다.

  • 7 저자 기여 진술: BC, LB, HN은 benchmark dataset을 생성하거나 큐레이션하고 실험을 수행했다.HN은 세 개의 benchmark를 큐레이션했으며, BC는 Connect-the-Dots를, LB는 Ball Drop과 Maze Navigation을 생성했다.
  • 7 저자 기여 진술: HN은 평가와 human-versus-VLM agreement study를 이끌었고, BC는 method 개발, 코드, ablation, Connect-the-Dots와 VPCT에 대한 평가를 이끌었다.LB는 Ball Drop과 Maze Navigation 평가를 이끌고, open-source model, annotation quality, annotation-text alignment 실험을 수행했다.
  • 7 저자 기여 진술: BC와 LB는 manuscript 작성을 이끌었고, 모든 저자가 원고를 편집하고 검토했으며, BC, LB, AN은 demo를 개발했다.BC는 LB의 추가 기여와 함께 웹사이트 개발을 이끌었다.
  • 7 저자 기여 진술: BC와 LB는 기술 팀 리드로 활동했고, AN은 프로젝트를 감독했다.AN은 BC, LB와 함께 demo 개발에도 기여했다.

A 실제 응용 … C.1 통합 결과

이 논문은 실제 instructional 및 multi-turn 응용에서 SketchVLM을 시연하고, 다양한 데이터셋과 태스크에서 평가하며, 다른 sketching 접근법보다 향상된 통합 visual-reasoning 정확도와 annotation 품질을 보고한다.

  • A 실제 응용: SketchVLM은 AWS EC2 인스턴스 설정 과정을 시각적으로 안내하고 PyTorch 컨테이너와 GitHub CI/CD 파이프라인에 대한 multi-turn 설명을 지원한다.ChatGPT가 텍스트만으로 응답하는 것과 달리 시각적 annotation으로 응답하며, 다양한 실제 사용 사례를 지원한다.
  • B.1 Connect-the-Dots: connect-the-dots 데이터셋은 random-dot, outline, clutter 변화 subset에 걸친 100개 이미지로 구성된다.Random-dot 이미지는 4–10개의 번호가 매겨진 점을 포함하며, outline 퍼즐은 30개의 Openclipart SVG 실루엣에서 파생된다.
  • B.2 Counting: counting 데이터셋은 CountBench [5], TallyQA, Pixmo-Count 를 결합하며, object count가 0에서 10까지인 총 1,189개 샘플로 구성된다.CountBench와 TallyQA가 746개 샘플을, Pixmo-Count가 filtering 후 443개 샘플을 제공한다.
  • B.3 Drawing Shapes around Objects: drawing-shapes 데이터셋은 object count, class, object size에 걸쳐 균형을 맞춘 COCO validation 이미지 1,000개를 선별해 구성된다.선별 대상은 small, medium, large object를 포괄한다.
  • B.4 Part Labeling: part-labeling 데이터셋은 PACO 와 Pascal-Part 에서 충분히 크고 풍부하게 annotation되었으며 class-balanced인 single-object 이미지를 선별해, 52개 class에 걸친 985개 이미지를 구성한다.각 object는 이미지의 최소 10%를 차지하고, 최소 4개의 annotation된 part를 가진다.
  • B.5 Maze Navigation: Maze navigation은 200개의 고유한 3x3 grid를 사용하며, 여기서 모델은 명령된 경로가 border wall을 넘지 않고 goal에 도달하는지 판별한다.최단 ground-truth 경로의 길이는 3에서 8단계이며, 한 방향을 무작위로 변경해 유효하지 않은 경로를 만든다.
  • B.6 Ball Drop: Ball Drop 평가는 100개의 VPCT 이미지로 dropped ball이 도달하는 bucket을 예측하고, trajectory drawing을 평가하기 위한 generated benchmark를 추가한다.VPCT는 physics-understanding 사례를 제공하지만 ground-truth ball trajectory는 제공하지 않는다.
  • C.1 통합 결과: 다른 sketching 접근법보다 평균 visual-reasoning 정확도에서 +28.5 points, 1–5 scale의 VLM-judged annotation 품질에서 +48.3%를 달성한다.정확도 평균은 VPCT, Ball Drop, Maze, Counting 태스크를 포괄하며, 품질 비교는 통합 annotation 결과를 사용한다.

C.2 점 잇기 … D.1 공 떨어뜨리기

점 잇기, counting, 도형 그리기, 부위 라벨링, 추가 모델, ball-drop 평가 전반에서 SketchVLM은 정확도, grounding, recall, annotation fidelity 측면의 과제별 향상과 한계를 드러낸다. 정성적 결과는 Gemini-3-Pro-Preview가 가장 정확한 ball-drop annotation을 생성하는 한편, SketchVLM이 궤적 시뮬레이션과 정확도를 개선함을 추가로 보여준다.

  • C.2 점 잇기: Nano Banana Pro는 37%의 사례에서 오류 없이 점 잇기를 완료해, 존재하지 않는 점을 추가하거나 점의 순서를 잘못 배치하는 경우가 잦은 Gemini-2.5-Flash-Image보다 우수한 성능을 보인다.그리드가 있는 경우와 없는 경우의 평균 MSE도 보고되며, 음의 percentage change는 개선을 의미한다.
  • C.2 점 잇기: 점 잇기에서 Gemini-2.5-Flash-Image는 존재하지 않는 점을 자주 추가하거나 점의 순서를 위반하는 반면, Nano Banana Pro는 significantly better한 성능을 보이지만 여전히 완벽하지 않다.
  • C.3 Counting: SketchVLM은 counting에서 high text-location accuracy를 달성해 예측한 개수가 대상 객체와 잘 일치함을 보여주지만, grounding은 상당히 약하다.
  • C.4 객체 주변 도형 그리기: Sketch 기반 localization은 중간 크기와 큰 객체의 AP50을 개선하지만 작은 객체에서는 성능을 낮추며, SketchVLM은 true positive가 더 적어져 precision을 유지하는 대신 lowers recall한다.서로 다른 prompt 변형은 drawing-shape 과제의 AP 성능을 개선하지 않는다.
  • C.5 부위 라벨링: 부위 라벨링 평가는 labeling 및 part-labeling 과제에서 원래 모델과 SketchVLM의 error-type breakdowns를 보고한다.
  • C.6 추가 모델 결과: 추가 모델 ablation은 점 잇기에 RMSE, 다른 과제에 accuracy, 점 순서 결정에 order accuracy를 사용해 stroke, system prompt, coordinate grid를 비교한다.Multi-turn 평가에서는 과제 그룹별 평균 turn 수도 보고한다.
  • D 정성적 샘플: 정성적 ball-drop 예시에서 Gemini-3-Pro-Preview는 most accurate annotations를 생성하는 반면, NanoBanana Pro, ThinkMorph, ViLaSR은 벽을 가로지르고 잘못 답하는 경우가 많다.
  • D.1 Ball Drop: SketchVLM은 ball drop에서 VLM accuracy를 boosts하는 동시에 ground-truth 데이터와 밀접하게 유사한 궤적 경로를 생성한다.

D.2 미로 탐색 … D.6 부분 라벨링

부록은 미로 탐색, 점 잇기, 계수, 도형 그리기, 부분 라벨링 과제 전반의 정성적 비교를 제공한다. 이 예시들은 모델 출력과 overlay를 시각화하며, 점 잇기에서는 보고된 경우 MSE도 제시한다.

  • D.2 미로 탐색: 미로 탐색 예시는 valid 및 invalid 경로에서의 모델 출력을 보여준다.부록은 성공한 경로 예측과 실패한 경로 예측에 대한 별도의 정성적 예시를 제시한다.
  • D.3 점 잇기: 점 잇기 결과는 여러 모델, GPT-5 reasoning level, multi-turn variants, sketching baseline에 걸쳐 정성적으로 비교된다.비교 대상은 random dots, worksheets, outlines를 포함한다. random-dot figure는 overlay와 MSE를 보여주며, Gemini-2.5-Pro는 Grid MSE 1080, Qwen3-235B는 N/A로 보고된다.
  • D.4 계수: 계수 과제 예시는 모델의 시각적 출력을 정성적으로 비교한다.제공된 figure caption은 계수 과제의 정성적 비교를 식별하지만, 과제별 결과값은 제공하지 않는다.
  • D.5 도형 그리기: 도형 그리기 예시는 지정된 객체 범주를 찾기 위한 Nano Banana, Gemini 3.0 Pro, SketchVLM overlay를 비교한다.제시된 prompt 중 하나는 모델에게 모든 oven과 refrigerator를 찾도록 요청하며, figure는 도형 그리기 출력을 비교한다.
  • D.6 부분 라벨링: 부분 라벨링 시연은 해부학적·구조적 구성 요소를 포함해 점점 더 세분화된 object vocabulary를 아우른다.나열된 label은 arm과 seat 같은 bench 부품부터 eyes, limbs, torso, facial features를 포함한 bird와 person의 부위까지 다양하다.
  • D.6 부분 라벨링: 부분 라벨링 예시는 다양한 객체의 specified parts를 라벨링하는 Nano Banana, Gemini 3.0 Pro, SketchVLM을 비교한다.예시는 benches, spoons, bottles, buses, birds, people을 다루며, prompt는 라벨을 나열된 부위로 제한한다.

D.7 연결점 잇기: Grid 대 No Grid … E VLM-Judge 세부 사항

보충 분석에서는 연결점 잇기 주석을 대상으로 좌표 grid, 곡선 표현, 좌표계, multi-turn 상태 처리를 살펴본 뒤 VLM judge를 사람 평가와 비교해 검증한다. Judge는 사람과 중간 정도의 일치도를 보이며 확장 가능한 비교에 유용하지만, 미묘한 오류에는 여전히 사람 평가가 더 신뢰할 만하다.

  • D.7 연결점 잇기: Grid 대 No Grid: 기준 좌표 grid를 추가하면 주석이 더 정밀해지지만 성능은 향상되지 않는다.Grid는 입력 이미지의 가장자리에 덧붙인다.
  • D.8 연결점 잇기: Bézier 곡선 대 직선: Bézier 곡선은 직선보다 더 적은 획으로 점을 연결하며, 덜 울퉁불퉁하고 미적으로 더 보기 좋은 도형을 만든다.비교 대상은 task accuracy가 아니라 주석 효율성과 시각적 매끄러움이다.
  • D.9 Gemini-3-Pro-Preview 좌표계: 0–2000 좌표계를 사용하면 전체적인 형태는 대체로 보존되지만, 일반적인 0–1000 좌표계에 비해 주석이 압축되거나 이동할 수 있다.모델이 대체로 적응하지만, 이러한 실패는 성능을 낮추며 grid 사용 시 결과가 더 나빠지는 이유일 수 있다.
  • D.10 Multi-turn Ablation: Multi-turn generation에서 이전 주석의 텍스트 표현을 생략하면 모델이 새 획을 연결하는 대신 이전 획을 다시 그리므로 drawing quality가 저하된다.이 실패로 기존 trajectory와 제대로 통합하지 못한다.
  • E VLM-Judge 세부 사항: 사람과 VLM의 일치도는 중간 수준이다(κ = 0.51 ± 0.02; Pearson r = 0.52 ± 0.01). 이는 일부 미묘한 논리 오류를 놓치더라도 확장 가능한 평가를 뒷받침한다.여러 task와 model에서 평점은 양의 상관을 보이지만, 벽을 가로질러 잘리는 trajectory는 간과될 수 있다.
  • E VLM-Judge 세부 사항: SketchVLM은 평가된 task 전반에서 다른 annotation model보다 더 높은 평균 human annotation-quality score를 달성한다.Table E4에는 task별 및 전체 평균과 표준편차가 보고되어 있다.

E.1 정성적 예시 … F.2 SketchVLM 시스템 프롬프트

부록에서는 정성적 비교, 평가 rubric, API 설정, 그리고 SketchVLM의 single-turn 및 multi-turn annotation을 규정하는 시스템 프롬프트를 제공한다. 프롬프트는 좌표 규약, 구조화된 SVG 출력, task별 drawing 제약, multi-turn 상호작용을 위한 guard를 명시한다.

  • E.1 정성적 예시: 정성적 예시에서는 원래 sketching model의 답변과 valid 및 invalid path에 대한 judge 답변을 비교하고, VPCT와 maze navigation에 대한 VLM-Judge 점수를 함께 제시한다.비교 대상은 valid 및 invalid maze path를 모두 포함하며, 점수는 VPCT와 maze-navigation 사례에 대해 별도로 보고된다.
  • E.2 Rubric 프롬프트: VPCT 및 ball-drop rubric은 원본 이미지와 annotation 이미지에서 지정된 속성을 기준으로 AI annotation을 평가한다.부록에는 rubric 설명과 이를 표시한 figure가 모두 포함된다.
  • E.2 Rubric 프롬프트: maze-navigation rubric도 제공된 rubric 속성만 사용해 원본 이미지와 AI annotation 이미지에서 sketch quality를 평가한다.rubric은 텍스트로 문서화되어 있으며 별도의 figure에도 표시된다.
  • F.1 API 설정: provider별 model inference 설정은 별도의 API-settings table에 요약되어 있다.제공된 본문에서는 이를 Table F1로 식별하지만 cell 값은 제시하지 않는다.
  • F.2 SketchVLM 시스템 프롬프트: multi-turn generation 중에는 one-stroke guard가 drawing turn 수를 제한하고, 한 turn에서 추가 stroke가 생성되지 않으면 final-answer guard가 뒤따른다.시스템 프롬프트 figure는 single-turn 및 multi-turn SketchVLM model에 공통으로 사용되는 prompt를 문서화한다.
  • F.2 SketchVLM 시스템 프롬프트: counting prompt는 object마다 번호가 매겨진 SVG text stroke를 하나씩 요구하고, stroke마다 정확히 하나의 point를 지정하며, object가 없을 때도 완전한 wrapper를 요구한다.또한 prompt는 출력이 지정된 XML-like answer 및 strokes structure를 따르도록 요구한다.
  • F.2 SketchVLM 시스템 프롬프트: 일반 labeling prompt는 annotation을 나열된 part로 제한하고, 정확한 XML-like structure에서 각 label마다 SVG text stroke를 하나씩 요구한다.label example에서는 xAyB point에 text를 배치하고 label_head와 같은 identifier를 할당한다.
  • F.2 SketchVLM 시스템 프롬프트: 시스템 프롬프트는 configurable x/y resolution과 top-left 또는 bottom-left coordinate origin을 지원하며, 선택한 origin에 맞춰 example을 조정한다.coordinate parameter는 res_x, res_y, origin이며, res_x와 res_y는 coordinate count를 결정하고 origin은 corner를 선택한다.

F.3 SketchVLM 출력 예시 · G 기타 Baselines · G.1 Baselines

부록에서는 SketchVLM의 VPCT sketch 출력을 보여 주고, image-editing 및 fine-tuned sketching baseline을 정의하며, 각 출력 형식과 학습 방식에 따라 필요한 평가 선택을 설명한다. Fine-tuned model은 의미 있는 no-sketch mode가 없으므로 sketch-conditioned setting에서만 평가한다.

  • F.3 SketchVLM 출력 예시: Gemini-3-Pro-Preview를 프롬프트로 제공하면 SketchVLM은 VPCT에 대해 색이 적용된 편집 가능한 스타일의 stroke annotation을 생성한다.이 예시에서는 시각적 검사를 개선하기 위한 목적으로만 각 stroke에 서로 다른 색을 적용한다.
  • G 기타 Baselines: 부록에서는 예시용 SketchVLM 출력과 image editing 또는 unconditional sketch 학습 model이 필요한 baseline 절차를 구분한다.이러한 구분에 따라 각 baseline의 평가 방식이 결정된다.
  • G 기타 Baselines: Baseline suite에는 먼저 sketch를 생성한 뒤 edited image를 Gemini-3-Pro-Preview에 전달해 최종 task answer를 생성하는 image-editing model이 포함된다.Nano Banana Pro는 이 two-stage procedure로 평가한다.
  • G.1 Baselines: Nano Banana Pro의 출력이 structured sketch representation에 항상 깔끔하게 대응하지는 않으므로, 추가로 manual Connect-the-Dots evaluation을 수행한다.이 manual evaluation은 해당 task에 대한 model의 benchmark assessment를 보완한다.
  • G.1 Baselines: ViLaSR 및 ThinkMorph와 같은 fine-tuned sketching model은 SketchVLM과 동일한 task prompt를 사용한다.이 model은 항상 sketch를 출력하도록 학습된다.
  • G.1 Baselines: Fine-tuned sketching model은 항상 sketch를 생성하므로, 주요 결과에서는 baseline VQA accuracy를 제외하고 sketch-conditioned performance만 보고한다.따라서 이 model에는 의미 있는 no-sketch baseline mode가 없다.
Loading 2604.22875v2…