Source-linked AI summary
Beyond NL2Code: A Structured Survey of Multimodal Code Intelligence
Xuanle Zhao, Qiushi Sun, Jingyu Xiao, Xuexin Liu, Haoyue Yang, Qiaosheng Chen, Xianzhen Luo, Jing Huang, Yufeng Zhong, Lei Chen, Shuai Fu, Zhenlin Wei, Jinhe Bi, Lei Jiang, Haibo Qiu, Siqi Yang, Peng Shi, Jian Hu, Zhixiong Zeng
TL;DR
Multimodal code task는 시각적 artifact와 grounded state를 사용하지만, 기존 평가는 correctness의 일부만 포착하는 경우가 많다. 이 survey는 네 가지 domain에 걸쳐 분야를 체계화하고, visual fidelity와 interactive correctness가 서로 괴리될 수 있음을 보여주며 단일 출력 유사도를 넘어선 validation의 필요성을 제기한다.
문제
Multimodal code intelligence는 외관, 구조, semantics, interaction을 아우르는 visual input, executable representation, correctness dimension을 통합적으로 다루지 못하고 있다.
방법
이 survey는 code의 역할에 따라 task를 분류하고, method와 benchmark를 네 가지 domain으로 구성하며, 각 task formulation과 evaluation signal을 기록한다.
결과
IWR-Bench에서 visual fidelity는 64.25%, interactive function은 24.39%에 도달했으며, 이는 rendered similarity와 interaction correctness가 서로 다른 capability를 측정함을 보여준다.
시사점 및 한계
Correctness assessment는 단일 image, program, preference score를 보편적 근거로 간주하기보다 각 visual-code artifact에 부합하는 signal을 결합해야 한다.
시사점 및 한계
Benchmark가 correctness의 서로 다른 단면을 관찰하고, cross-task transfer evaluation도 causal transfer를 분리해 검증하는 경우가 드물기 때문에 cross-method comparison은 여전히 제한적이다.
Abstract
from arXiv · showhide
While Large Language Models (LLMs) have substantially advanced text-to-code synthesis, many real programming tasks specify intent through visual artifacts such as screenshots, charts, vector drawings, videos, and interactive states. These tasks require models to connect visual perception to executable programs, because correctness depends not only on syntax but also on layout, data semantics, interaction behavior, and domain-specific constraints that apply after execution. This survey examines Multimodal Code Intelligence, covering systems that generate, edit, refine, or reason with code under visually grounded inputs and outputs. We first formulate the field by the role that code plays in each task, distinguishing code as a rendered artifact, an editable symbolic structure, a scientific representation, an intermediate reasoning trace, or an executable policy or tool interface. We then organize benchmarks and methods into four domains: Graphical User Interface, Scientific Visualization, Structured Graphics, and Frontier Tasks and Frameworks. This taxonomy connects mature artifact-generation problems to emerging agentic and unified settings and allows us to compare how different tasks treat evidence of correctness. Looking ahead, we argue that future research may benefit from four verification-centered directions. Multi-signal validation can combine complementary evidence of correctness, multi-state verification can test behavior across execution trajectories, cross-task transfer testing can probe reusable visual-code skills, and verifiable agent traces can reveal whether agent actions are grounded in visual evidence. Together, these directions may move this field from single-output imitation toward evidence-grounded executable systems. An ongoing project and resources are available on \href{https://github.com/xjywhu/Awesome-Multimodal-LLM-for-Code}{GitHub}.
1 서론
Multimodal Code Intelligence는 텍스트 중심 코드 생성과 시각적 artifact 또는 상태에 기반한 프로그래밍 작업 사이의 간극을 다룬다. 이 survey는 code의 역할에 따라 분야를 정식화하고, 이를 네 가지 domain으로 구성하며, 시각적 grounding을 갖춘 code generation, editing, verification, execution, reasoning을 포괄하는 review 범위를 정의한다.
- 동기: 시각적 입력은 조밀한 공간 및 구조 정보를 인코딩하므로, 텍스트 중심 NL2Code 접근법은 특히 시각 중심 domain에서 이를 놓치는 경우가 많다.이 survey는 순차적 텍스트와 높은 대역폭의 시각적 커뮤니케이션을 대조하여 multimodal code intelligence의 필요성을 제시한다.
- 분류 체계: 이 survey는 Multimodal Code Intelligence를 Graphical User Interface, Scientific Visualization, Structured Graphics, Frontier Tasks and Frameworks로 구성한다.이 domain들은 frontend code generation, plotting script, 구조화된 vector 또는 diagram code, 그리고 새롭게 등장한 agentic 또는 unified setting을 포괄한다.
- 문제 정식화: 이 survey는 code가 rendered artifact, 편집 가능한 structure, reasoning trace, scientific representation, executable policy, 또는 tool interface로 기능하는지에 따라 task를 구분한다.이 정식화는 이질적인 multimodal code-generation task를 각 domain에서 code가 수행하는 지배적 역할과 연결한다.
- Survey 방법론: 이 review는 source collection, candidate screening, taxonomy assignment, manual consistency check를 거치며, January 2026까지 업데이트된 문헌 snapshot을 사용한다.source는 arXiv와 주요 venue에서 수집하며, 2022–2026의 최신 연구와 중요한 task 또는 evaluation protocol을 정의한 이전 논문에 중점을 둔다.
- 범위: 범위에는 시각적으로 grounding된 generation, editing, verification, execution, reasoning이 포함되지만, 순수하게 언어에 의해 구동되는 code generation과 관련 없는 software-engineering issue resolution은 제외된다.포함된 연구는 visual input, output, 또는 grounding된 state를 사용할 수 있으며, code를 render 가능한 representation, intermediate trace, executable artifact, 또는 action interface로 다룰 수 있다.
2 과제 정식화
Section 2는 visual-to-code synthesis와 code-centric reasoning을 통해 Multimodal Code Intelligence를 정식화하고, code가 artifact, symbolic intermediary 또는 executable policy로 기능하는 방식을 구분한다. 또한 visual evidence, execution, interaction을 연결하는 세 가지 synthesis subtask와 두 가지 reasoning pathway를 정의한다.
- 2 과제 정식화: 이 taxonomy는 Multimodal Code Intelligence를 visual-to-code synthesis와 code-centric reasoning paradigm으로 구성한다.이 절의 formal task framework를 제시한다.
- 2.1 NL2Code 예비 지식: 기존 NL2Code는 natural language에서 executable program을 synthesis하지만, visual grounding된 intent에 필수적인 spatial requirement를 인식하지 못한다.이러한 한계는 logic-centric task를 넘어서는 multimodal extension의 동기를 제공한다.
- 2.2 Multimodal Code Synthesis: Multimodal Code Synthesis는 visual context, rendered feedback 또는 시각적으로 지정된 intent가 핵심일 때 code를 생성하거나 수정한다.이 framework는 direct generation, instruction-driven editing, reference-based refinement를 구분한다.
- 2.2 Multimodal Code Synthesis: Direct generation은 visual context와 text에서 code를 synthesis하여 요청된 artifact를 생성하며, visual fidelity를 위해서는 올바른 layout, geometry, style, visible content가 필요하다.이 task는 reconstruction과 multimodal specification을 다루며, execution이 resulting artifact를 결정한다.
- 2.2 Multimodal Code Synthesis: Instruction-driven editing은 textual 또는 visual prompt에 따라 visual content를 변경하고, visual reasoning, spatial grounding, counterfactual code synthesis를 평가한다.Editing은 structural guidance의 유무와 관계없이 수행될 수 있다.
- 2.2 Multimodal Code Synthesis: Reference-based refinement는 visual reference 또는 constraint에 맞춰 잠재적으로 결함이 있는 draft를 개선하며, alignment와 debugging을 위한 structural prior로 draft를 사용한다.Source-code-agnostic editing과 달리 refinement는 initial code state를 명시적으로 활용한다.
- 2.3 Code-Centric Reasoning과 Acting: Programmatic tool-use는 deterministic execution만으로 query를 완전히 해결하거나, 후속 inference 전에 visual input을 처리하여 symbolic derivation과 perception-aware reasoning을 지원한다.Execution은 최종 answer 또는 crop이나 edge-detected image와 같은 augmented view를 생성할 수 있다.
- 2.3 Code-Centric Reasoning과 Acting: Code-centric reasoning은 executable code를 symbolic intermediary 또는 policy로 취급하며, visual reasoning과 environmental control을 위한 programmatic tool-use와 executable policy를 포괄한다.Programmatic tool-use는 visual query를 modular program으로 분해하고, policy는 sequential environment에서 observation과 goal을 structured action으로 매핑한다.
3 그래픽 사용자 인터페이스
GUI 코드 인텔리전스는 웹과 모바일의 생성, 편집, 정제를 아우르지만, 평가는 시각적 재구성과 실행 가능한 상호작용 및 런타임 동작을 연결해야 한다. 브라우저는 웹 작업에 가장 명확한 검증 기반을 제공하는 반면, 파편화된 모바일 환경에서는 네이티브 정확성을 평가하기가 더 어렵다.
- 범위: GUI 코드 생성은 웹과 모바일 전반의 시각 입력에서 실행 가능한 구현으로의 변환을 다루며, 직접 생성, 편집, 정제, 액션 재생, 환경 전환 검사를 포함한다.
- 웹-코드 평가: 웹 벤치마크는 세 가지 지배적인 정확성 신호를 드러낸다: 정적 렌더링, 실행 가능한 상호작용, 특화된 선호도 또는 에이전트 작업 평가.브라우저는 렌더러이자 평가기 역할을 하므로 HTML, CSS, JavaScript, WebDriver를 통한 확장 가능한 검사와 상호작용이 가능하다.
- 방법론의 궤적: 웹-코드 방법은 모방 기반 재구성과 직접적인 지도 미세 조정에서 분해된 에이전트, 반복적 시각 피드백, 비평가 수정, 재생, 실행 가능한 검증으로 발전해 왔다.이러한 접근법은 점차 grounding, planning, implementation, review, rendering feedback, interaction feedback을 검사 가능하거나 교정 가능한 신호로 활용한다.
- 검증 방향: GUI 평가는 브라우저 렌더링만으로 충분한 검증이라고 간주하기보다 시각적 목표를 구조화된 요구사항, 재생 가능한 액션, 상태 assertion, 코드 수준 검사와 결합해야 한다.시각적 metric은 지각적 정렬을 포착하고, 상호작용 테스트는 행동 정확성을 포착하며, 코드 분석은 유지보수성과 아키텍처 타당성을 포착한다.
- 웹-코드 평가: IWR-Bench에서 시각적 충실도 64.25% 대 상호작용 기능 24.39%라는 결과는 렌더링 유사도와 상호작용 정확성이 서로 다른 능력을 측정함을 보여준다 (Chen et al., 2025m).정적 스크린샷은 이벤트 로직, 상태 변화, 컴포넌트 경계, 데이터 흐름을 감출 수 있다.
- 모바일-코드: 모바일-코드 평가는 네이티브 애플리케이션이 플랫폼 간에 공유되는 렌더링 또는 상호작용 환경이 없는 컴파일된 바이너리이기 때문에 구조적으로 파편화되어 있다.현재의 대리 신호만으로는 네이티브 컴파일, 플랫폼 위젯, 제스처, 상태 변화, 접근성, 유지보수 가능한 구현을 검증할 수 없다.
4 과학 시각화 · 4.1 통계 차트 · 4.2 구조화 문서
과학 시각화 code intelligence는 차트와 구조화 문서의 외형만이 아니라 그 이면의 의미론을 보존해야 한다. 이 survey는 이러한 과제를 의도 충족, 재구성 충실도, 다중 문법 복원, 실행 가능한 구조화 출력에 의한 검증을 중심으로 구성한다.
- 4 과학 시각화: 과학적 시각화 code artifact는 시각적 출력 이면의 과학적 의미론을 보존해야 하며, code는 주로 생성이나 refinement에 사용되고 때로는 설명 또는 validation trace로 사용된다.
- 4.1 통계 차트: 통계 차트 생성은 NL-to-Chart intent-to-code synthesis와 Chart-to-Code visual reverse engineering으로 나뉘며, 두 방식은 서로 다른 제약과 correctness target을 부과한다.NL-to-Chart는 하나의 질의를 여러 시각화가 충족할 수 있어 명세가 불충분한 반면, Chart-to-Code는 렌더링된 차트에서 data, encoding, plotting logic을 재구성한다.
- 4.1 통계 차트: 차트 benchmark는 텍스트 의도에 대해 실행 가능하고 의미론적으로 적절한 출력을 평가하지만, reconstruction benchmark는 복원된 data, visual encoding, 편집 가능하거나 실행 가능한 plotting logic을 평가한다.Chart-to-Code benchmark는 reconstruction fidelity를 강조하는 반면, NL-to-Chart benchmark는 execution, semantic judgment, task compliance를 통해 intent satisfaction을 근사한다.
- 4.1 통계 차트: 차트 방법론도 이러한 구분을 따른다. NL-to-Chart는 planning, visual feedback, instruction tuning을 사용하고, Chart-to-Code는 chart-code data, rendering-aware feedback, editing-oriented optimization을 사용한다.Preference-driven 접근법은 텍스트 code similarity만이 아니라 실행된 visual 및 data outcome을 기준으로 program을 최적화한다.
- 4.1 통계 차트: 차트 correctness는 data, visual encoding, intent fidelity에 분산되어 있으므로, 그럴듯한 외관이나 code similarity만으로는 올바른 값, aggregation, 비교, analytic claim을 입증할 수 없다.향후 benchmark는 visual reconstruction을 data recovery 및 executable rerendering과 결합하고, multi-signal verification을 통해 NL-to-Chart intent satisfaction과 analytic appropriateness를 평가해야 한다.
- 4.2 구조화 문서: 구조화 문서 생성은 하나의 serialized output에서 reading order, layout, text, table, formula, cross-region reference를 보존해야 하는 다중 문법 복원 문제다.대표적인 정식화로는 서로 다른 문서 구조와 output language를 포괄하는 Document-to-Markdown, Table-to-Code, Formula-to-LaTeX benchmark가 있다.
- 4.2 구조화 문서: 문서 parsing은 character accuracy를 넘어 full-page layout, table, formula를 포함한 이질적 요소 전반의 reading order, correctness, structural coherence를 평가하는 방향으로 발전했다.Pipeline, end-to-end VLM, reinforcement-learning 방법은 prose, table, formula, layout relation에 적용되는 서로 다른 structural rule을 다룬다.
- 4.2 구조화 문서: 구조화 문서 correctness는 reading order, layout, table grid, formula grammar, output executability를 포괄하므로, 조밀한 layout, domain convention, cross-page dependency를 갖춘 현실적인 benchmark가 필요하다.장기적인 목표는 상호보완적인 Markdown, HTML, LaTeX target을 사용해 다양한 문서를 렌더링 가능한 구조화 표현으로 변환하는 것이다.
4.3 학술 프레젠테이션 · 4.4 과학적 시연
학술 프레젠테이션은 연구를 일관되고 편집 가능한 시각적 서사로 변환하는 반면, 과학적 시연은 설명이 도메인 지식과 교육적 의도에 충실해야 하는 실행 가능한 산출물을 생성한다. 두 설정 모두에서 시각적 개연성만으로는 충분하지 않다. 정확성을 위해서는 주장, 코드, 렌더링된 상태, 상호작용, 검증 사이의 점검 가능한 연결이 필요하다.
- 4.3 학술 프레젠테이션: 학술 프레젠테이션에서는 슬라이드, 포스터, 내레이션 비디오 전반에서 시각적 일관성, 편집 가능성, 발표 흐름을 유지하면서 모델이 증거를 선택하고 재배열하며 강조해야 한다.정확성은 논거 선택, 편집 가능한 객체 구조, 청중의 주의, 순차적 서사, 단일 캔버스의 밀도, 시간적 정렬을 포괄한다.
- 4.3.1 학술 프레젠테이션 생성 benchmark: 프레젠테이션 benchmark는 슬라이드 생성 및 편집, slide-to-code reconstruction, 프레젠테이션 비디오, 포스터 압축을 다루지만, 수사적 순서 구성, 발표자의 의도, 의사소통 효과는 부분적으로만 측정한다.Zenodo10K에는 엄선된 프레젠테이션 10,448개가 포함되지만, 각 configuration에서는 표본으로 추출한 500개 task에 대한 생성 결과를 보고한다. 포스터 평가는 독자 시뮬레이션과 checklist 기준을 포함한다.
- 4.3.2 학술 프레젠테이션 생성 방법: 프레젠테이션 방법은 programmatic rendering API, 편집 가능한 객체 조작, 시각적 피드백을 사용하며, binary-tree 포스터 레이아웃과 텍스트 overflow를 수정하는 painter-commenter repair를 포함한다.이러한 경로는 고수준 콘텐츠 계획, visual-to-code reconstruction, 가변 길이 콘텐츠를 위한 공간 계획, 동적 레이아웃 수정을 지원한다.
- 4.3.2 학술 프레젠테이션 생성 방법: 향후 프레젠테이션 시스템은 주장, 증거, 레이아웃 역할, 시각적 현저성, 수정 이력을 연결하는 중간 표현을 사용하고, overflow, overlap, 편집 성공, 논거 복원을 점검하는 benchmark를 마련해야 한다.평가는 산출물이 그럴듯해 보이는지만이 아니라 주장-증거 정렬과 독자의 정보 복원을 검증해야 한다.
- 4.4 과학적 시연: 과학적 시연은 분자 스크립트, 상호작용형 STEM 웹페이지, 정리 애니메이션과 같은 실행 가능한 시각적 설명을 생성하며, 코드는 방정식, 도메인 제약, 메커니즘, 교육적 의도를 보존해야 한다.일반적인 plotting과 달리 렌더링 결과는 원천 콘텐츠, 실행 가능한 프로그램, 산출물, 검증 신호 전반에서 증거에 기반한 설명으로 기능해야 한다.
- 4.4.1 과학적 시연 생성 benchmark: 과학적 시연 benchmark는 다중 도메인 시각적 추론, 상호작용형 front-end 산출물, workflow 또는 tool-use 요구사항을 포함해 코드로 렌더링된 설명과 상호작용형 교육을 평가한다.EduVisBench는 교육학 이론에 근거한 세분화된 rubric을 사용하며, 인접한 ScienceAgentBench와 ScienceBoard는 더 광범위한 과학 agent workflow를 다룬다.
- 4.4.2 과학적 시연 생성 방법: 과학적 시연 방법은 실행 가능한 도구, retrieval, runtime repair, 단계적 계획, 코딩, 애니메이션 생성을 사용해 renderer-driven supervision과 agentic explanation workflow를 결합한다.CoSyn은 400K multimodal image와 2.7M instruction을 합성하며, agentic system은 학습 목표, 추론, 검색된 지식, 코드, 렌더링된 설명을 조정한다.
- 4.4.2 과학적 시연 생성 방법: 그럴듯한 시각 자료가 잘못된 메커니즘을 숨길 수 있으므로, 향후 시연은 도메인별 validator를 통해 방정식, 매개변수, package call, 코드, 도구 출력, 렌더링된 상태를 점검 가능하게 유지해야 한다.시각적 유사성만으로는 잘못된 값, 손상된 구조, 누락된 주장, 잘못된 메커니즘, 검증할 수 없는 도구 출력을 감지할 수 없다.
5 구조화 그래픽
구조화 그래픽은 코드를 상징적이고 편집 가능하며 실행 가능한 표현으로 다루며, 정확성은 렌더링만이 아니라 객체 구조, 논리적 관계, 구성 절차에 좌우된다. 따라서 SVG, 다이어그램, CAD에서는 시각적 충실도와 함께 구조적 동등성도 검증해야 한다.
- 개요: 구조화 그래픽은 생성을 픽셀 재현에서 객체, 관계, 제약조건, 구성 절차를 드러내는 상징적이고 편집 가능하며 실행 가능한 표현으로 전환한다.핵심 실패 양상은 구조적 비동등성이다. 그럴듯한 렌더링이 객체 계층, 관계 그래프, 또는 매개변수 기반 구성 이력의 손실을 가릴 수 있다.
- SVG: SVG 생성은 텍스트 조건, 이미지 조건, 편집 과제 전반에서 렌더링 충실도와 간결하고 의미 있는 벡터 구조 사이의 균형을 맞춰야 한다.SVG 코드는 객체와 경로를 위한 이산 명령과 기하를 위한 연속 좌표를 결합하므로, 저수준의 긴 표현을 학습하고 작성하며 수정하기 어렵다.
- SVG: SVG 평가는 시각적 충실도, 기하학적 정밀도, 편집 가능성이 함께 정확성을 결정하므로 의미 정렬, 지각적 재구성, 구조적 또는 코드 품질 대리지표를 결합한다.대표적인 리소스는 텍스트 유도 합성, 이미지-to-SVG 재구성, 렌더링 피드백 설정을 아우르며, IconShop (Wu et al., 2023), StarVector, RLRF (Rodriguez et al., 2025b)가 포함된다.
- 다이어그램: 다이어그램 코드 생성은 단순히 형태와 좌표를 재구성하는 대신 제어 흐름, 의존성, 워크플로 상태, 타입이 지정된 연결성과 같은 논리적 관계를 보존해야 한다.향후 평가는 그래프 위상, 간선 방향, 분기 조건, 경로 도달 가능성, 분기 동등성, 실행 동작, 특정 시각적 질문을 검증해야 한다.
- CAD: CAD 연구는 형상 재구성에서 벗어나 기하, 제약조건, 피처 의존성, 편집 전파, 제조 가능성을 검증하는 검증 가능한 매개변수 기반 설계 합성으로 나아가야 한다.향후 벤치마크에는 복잡한 부품, 조립체, 다중 뷰 도면, 수정 지시, 도메인별 제조 요구사항이 포함되어야 한다.
6 Frontier Tasks and Frameworks
이 절에서는 code가 intermediate trace, tool call, environment policy, repair interface로서 perception, reasoning, action을 매개하는 frontier setting을 살펴본다. 논의는 visual manipulation, video, embodied control, grounded programming, unified multimodal generation을 아우르는 다섯 가지 process-reliability 과제를 중심으로 구성한다.
- 6 Frontier Tasks and Frameworks: Frontier task에서는 생성된 code를 단순한 rendered artifact가 아니라 intermediate trace, tool call, environment policy, repair interface로 다룬다.이러한 setting에서는 최종 visual object보다 process reliability에 중점을 둔다.
- 6 Frontier Tasks and Frameworks: 이 절에서는 synthesis와 acting 전반에 걸친 unified model을 고려하면서 이러한 setting을 programmatic tool-use와 executable-policy formulation에 연결한다.
- 6 Frontier Tasks and Frameworks: 논의는 다섯 가지 setting으로 구성된다: programmatic visual manipulation, video code generation, embodied control, visually grounded programming, unified multimodal code generation.
6.1 프로그래밍 기반 시각 조작
프로그래밍 기반 시각 조작은 단순히 시각적 산출물을 생성하는 대신 실행 가능한 코드를 사용해 시각적 증거를 검사하고 변환하며 구성한다. 핵심 과제는 중간 연산이 실행 가능하고, 근거에 기반하며, 재현 가능하고, 답변과 인과적으로 관련되는지 검증하는 것이다.
- 6.1 프로그래밍 기반 시각 조작: 이 분야에서는 코드를 시각적 증거를 자르고, 탐지하고, 측정하고, 그리고, 마스킹하고, 플로팅하거나 질의하는 실행 가능한 인터페이스로 다룬다.이는 시각적 추론을 중간 행동 공간으로 옮기며, 이 공간의 정확성은 최종 답변뿐 아니라 과정에도 좌우된다.
- 6.1 프로그래밍 기반 시각 조작: 최종 답변 정확도, 추적 실행 가능성, 과정 보상만으로는 여전히 불충분하다. 이 중 어느 하나만으로는 특정 연산이 답변을 유발했다는 사실을 입증할 수 없기 때문이다.더 강력한 평가는 답변 정확도에 연산 재실행과 영역 grounding을 결합해, 개입이 추론 추적에서 주장한 시각적 증거를 실제로 대상으로 삼는지 확인해야 한다.
- 6.1 프로그래밍 기반 시각 조작: 방법론은 제한적이고 검사 가능한 추적을 제공하는 사전 정의된 전문가 도구 또는 작업별 시각 연산을 합성하는 생성 프로그램을 사용한다.사전 정의된 도구는 알려진 연산을 지원하는 반면, 생성 코드는 자르기, 마스크, 스케치, 플롯, 측정, 형식적 구성을 만들어 적용 범위를 확장한다.
- 6.1 프로그래밍 기반 시각 조작: 학습 및 보상 방법은 최종 답변 정확도만 최적화하는 대신 계획, 실행, 픽셀 공간 연산, 증거 일관성을 점점 더 감독한다.여기에는 instruction tuning, chain-of-manipulation reasoning, 과정 보상, 실행 가능하고 증거와 일관된 도구 사용에 대한 보상이 포함된다.
- 6.1 프로그래밍 기반 시각 조작: 생성 시스템은 원본 이미지에 충분한 증거가 없을 때 스케치, 공간 지시자, 플롯, 강조 영역과 같은 보조 시각 뷰를 점점 더 구성한다.수학적·기하학적 설정에서는 생성된 플롯이나 형식화된 기하 요소가 중간 산출물을 점검하기 위한 외부 구조를 제공할 때 검증 가능성이 더욱 향상된다.
- 6.1 프로그래밍 기반 시각 조작: 향후 code-agent 워크플로는 고정된 API를 넘어 터미널, 파일, 라이브러리, 로그, 스캐폴드로 확장하면서 답변과 관련된 시각적 증거를 검증해야 한다.의도된 추상화는 실행 가능하고, 검사 가능하며, 재현 가능하고, 시각 영역에 grounding되며, 답변과 연결되어야 한다.
6.2 Video Code Generation
Video Code Generation은 Code-to-Video 저작과 Video-to-Code 절차 복원으로 구성되며, code가 시간적 구조를 제공하지만 현재 benchmark는 충실한 timing과 state evolution을 검증하지 못하는 경우가 많다. 따라서 이 절은 최종 결과 점수를 넘어 trajectory-aware, multi-signal evaluation을 핵심 방향으로 제시한다.
- Task Formulation: Video Code Generation은 시각적 artifact를 프로그래밍하는 Code-to-Video와 시연으로부터 실행 가능한 절차를 복원하는 Video-to-Code로 나뉜다.Code-to-Video는 layout, keyframe, narration, transition을 위한 저작 scaffold로 code를 사용하는 반면, Video-to-Code는 압축된 절차를 추출한다.
- Evaluation Bottleneck: 현재 benchmark는 의사소통상의 유용성이나 task completion을 평가하지만, temporal consistency, motion fidelity, 또는 충실한 state change를 어느 것도 안정적으로 검증하지 못한다.video는 내용을 보존하면서도 어색한 pacing이나 불연속적인 transition을 사용할 수 있고, policy는 velocity, contact timing, 또는 recovery behavior를 버린 채 성공할 수 있다.
- Code-to-Video: Code-to-Video system은 executable script를 planning layer로 사용하여 scene, narration, transition, explanatory animation의 high-level structure를 제약한다.Code2Video (Chen et al., 2025n), PresentAgent (Shi et al., 2025), Theorem ExplainAgent (Ku et al., 2025b)는 이러한 저작 역할을 보여주는 사례다.
- Video-to-Code: Video-to-Code system은 시각적 시연을 executable strategy로 압축하며, RoboPro 는 large-scale video data로부터 robotic manipulation policy를 합성하는 사례다.이러한 추상화는 고비용의 robot trajectory 수집 필요성을 줄일 수 있지만, 이 subsection은 RoboPro를 완전한 deployment 설명이 아니라 video-to-program abstraction으로 다룬다.
- Scope and Trajectory: 향후 benchmark는 최종 결과에만 의존하기보다 end outcome, trajectory consistency, event timing, narration- 또는 motion-aligned behavior를 함께 평가해야 한다.제안된 trajectory는 확립된 empirical trend가 아니라 evaluation expansion이며, 시각적 state의 sequencing에서 time-aware state evolution으로 나아가는 방향이다.
6.3 Embodied Control
Embodied Control은 시각적 관찰과 목표를 행동으로 매핑하는 code-centric policy를 연구하며, program, specification, reward 또는 policy script를 통해 실행을 매개한다. 검증에서 inspectable한 symbolic intent를 강조하면서도 continuous control, safety, recovery, embodiment가 여전히 필수적임을 인정한다.
- Embodied Control: Embodied Control은 생성된 program, reward function, specification 또는 policy script가 시각적 관찰과 목표로부터의 실행을 매개하는 code-centric setting에 초점을 둔다.이 범위에는 embodied vision-language-action policy에 대한 일반적인 survey는 포함하지 않는다.
- Embodied Control: VirtualHome [Puig et al., 2018]은 household activity를 executable program으로 모델링하며, 이후 benchmark는 language model이 embodied control logic을 생성할 수 있는지 평가한다.이러한 environment에서는 executable environment, skill program, task outcome을 통해 visual grounding을 관찰할 수 있다.
- Embodied Control: Code as Policies [Liang et al., 2022]와 ProgPrompt 는 API call, assertion, hierarchical logic을 노출하여 end-to-end policy보다 behavior를 더 inspectable하게 만든다.핵심 code-generation 경로는 실행을 직접 구조화하는 action script, skill program 또는 geometric procedure를 출력한다.
- Embodied Control: PACT [Wei et al., 2023], RoboCodeX [Mu et al., 2024], Octopus [Yang et al., 2024b]는 sensorimotor data, multimodal post-training, iterative SFT 또는 environmental reward를 사용해 생성된 control code를 개선한다.Environmental feedback은 code를 평가된 outcome과 연결하지만, binary success signal은 unsafe intermediate action, 약한 recovery, simulator 또는 robot에 특화된 behavior를 감출 수 있다.
- Scope and Trajectory: 향후 benchmark는 specification, execution, contact timing, safety, recovery, camera, object, tool, robot morphology의 변화 전반에서 symbolic intent와 continuous control 사이의 경계를 검증해야 한다.Code는 goal, object reference, spatial constraint, skill composition, reward term, recovery condition을 표현해야 하며, continuous adaptation은 robot controller에 맡겨야 한다.
6.4 시각적으로 근거된 프로그래밍
시각적으로 근거된 프로그래밍은 시각적 산출물을 프로그램과 관련된 제약이나 증거로 활용해 실행 가능한 코드를 생성하거나 수정한다. 이 분야는 알고리즘 및 소프트웨어 엔지니어링 benchmark를 아우르며, structured visual representation, agentic feedback, visual state에 대한 verification을 점차 결합하고 있다.
- 시각적으로 근거된 프로그래밍: 시각적으로 근거된 프로그래밍은 다이어그램, screenshot, 시각적 예시 또는 rendering된 실패를 실행 가능한 프로그램이나 repository patch를 제약하는 증거로 다룬다.정확성은 단순한 구문 유효성이 아니라 시각 정보가 code generation이나 patch refinement 과정에 반영되는지에 달려 있다.
- 시각적으로 근거된 프로그래밍: Benchmark는 시각적으로 근거된 알고리즘 프로그래밍과 소프트웨어 엔지니어링을 다루지만, text나 repository context가 우회 경로를 제공할 수 있으므로 최종 통과율만으로는 image grounding을 입증하지 못할 수 있다.Table 7은 task type, output language, visual-evidence role, correctness signal을 요약하며, 소프트웨어 엔지니어링 benchmark는 repair evidence로 screenshot과 video를 점차 포함하고 있다.
- 시각적으로 근거된 프로그래밍: 방법은 두 경로를 따른다: synthesis 전에 visual을 textual 또는 symbolic surrogate로 변환하거나, software-engineering agent 내부에서 visual feedback을 사용하는 것이다.CodeVision (Wang et al., 2025d)은 flowchart를 Mermaid code로 변환하고, SWE-agent M (Yang et al., 2024d;e)은 browser interaction, screenshot, image viewing, terminal operation을 추가한다.
- 시각적으로 근거된 프로그래밍: Textual surrogate는 code generation을 용이하게 하지만 공간 정보와 state 정보를 잃을 수 있는 반면, agentic feedback은 재현 가능한 환경, 안정적인 screenshot, 의미 있는 post-patch test에 의존한다.핵심 병목은 perception 자체가 아니라 code generation 또는 patch refinement를 거쳐 visual evidence를 보존하는 것이다.
- 시각적으로 근거된 프로그래밍: 향후 system은 graph structure, DOM과 browser state, rendering된 실패, interaction trace를 보존해야 하며, benchmark는 visual evidence가 예상 code location을 바꾸는지 평가해야 한다.Screenshot, browser trace, terminal log, reproduction script, localized edit, post-patch execution은 생성된 program이나 patch와 계속 연결되어 있어야 한다.
6.5 통합 Multimodal Code Generation
통합 multimodal code generation은 synthesis, editing, refinement, tool use, interactive artifacts, OCR, visualization, software tasks를 아우르는 공유 모델과 visual-code representation을 지향한다. 핵심적으로 아직 풀리지 않은 문제는 더 광범위한 데이터, 모델 통합, feedback이 단순히 수용 가능한 task의 범위를 넓히는 데 그치지 않고 재사용 가능한 cross-task abstraction을 만들어 내는가이다.
- 통합 Benchmark: 통합 benchmark는 structured-code reconstruction, rendering-code generation, interactive artifacts, visually grounded programming, iterative refinement을 포함해 visual-code grounding의 서로 다른 형태를 평가한다.이러한 다양성은 통합 평가를 가능하게 하지만 직접적인 점수 비교를 어렵게 만든다.
- 통합 Benchmark: Image2Struct (Roberts et al., 2024)는 이미지에서 structured code를 추출하는 능력을 평가하는 반면, ArtifactsBench (Zhang et al., 2025a)는 9개 domain에서 실행 가능한 interactive artifacts를 검증한다.Image2Struct는 CIS와 EMS를 사용해 webpages, mathematical formulas, musical scores를 다루며, ArtifactsBench는 1.8k queries와 checklist-guided MLLM judging을 사용한다.
- 방법 개발: 통합 방법은 cross-domain data, 통합된 vision-language 및 code models, feedback-aware optimization을 결합해 interface fragmentation을 줄이고 supervised fine-tuning만을 넘어선다.예로 VisCoder2 (Ni et al., 2025a), VisCodex (Jiang et al., 2025a), JanusCoder (Sun et al., 2025b), VinciCoder (Zhao et al., 2025b), OCRVerse (Zhong et al., 2026)가 있다.
- 범위와 향후 방향: 많은 task format을 수용한다고 해서 공유된 visual-code abstractions나 task 간 측정 가능한 transfer가 확립되는 것은 아니므로 통합은 아직 입증되지 않았다.현재 보고는 in-distribution task acceptance를 더 자주 보여 주며, mixture가 layout, events, state change에 관한 재사용 가능한 개념을 유도하는지는 여전히 해결되지 않았다.
- 핵심 요지: Frontier setting은 multimodal code generation을 artifact production에서 evidence inspection, 시간 모델링, environment에서의 행동, program repair, task 간 transfer 시도로 확장한다.따라서 correctness는 artifact appearance를 넘어 interaction behavior, domain meaning, editable symbolic structure 및 기타 실행 가능한 제약에 의존한다.
7 향후 연구 방향
향후 연구는 단일 정확성 신호를 역할에 맞춘 validator profile로 대체하고, execution episode, cross-task transfer, evidence-grounded agent trace를 통해 visual-code system을 평가해야 한다. 이러한 방향은 생성된 코드가 상태와 환경 전반에서 시각적·구조적·의미적·편집 가능·상호작용적 의도를 보존하는지 규명하는 것을 목표로 한다.
- 검증 신호: 역할에 맞춘 validator profile은 하나의 점수에 의존하기보다 visual similarity, execution success, textual correctness, semantic fidelity, structural validity, editability, interaction correctness를 분리해야 한다.단일 image, program, 또는 VLM preference만으로는 관련된 모든 속성을 인증할 수 없으므로, 신뢰할 수 있는 평가는 일반적으로 상호보완적인 검사를 요구한다.
- 다중 상태 검증: Stateful visual-code task는 initial state, generated action, intermediate observation, expected transition, validator output, recovery case를 포함하는 execution episode로 평가해야 한다.정적 rendering은 click, resizing, state update, timing, invalid mechanism, occlusion, contact, controller limit 상황에서 발생하는 실패를 가릴 수 있다.
- Cross-task transfer: Unified model은 held-out skill, primitive, composition에 대한 cross-task transfer를 평가받아야 하며, matched mixture control과 비교해 positive transfer와 negative transfer를 모두 보고해야 한다.이를 통해 단순히 더 많은 task format을 수용하거나 in-distribution performance가 향상된 것과, 재사용 가능한 layout·symbolic-relation·interaction skill을 구분할 수 있다.
- 검증 가능한 agent trace: Agentic visual-code system은 observation과 visual region을 changed code 또는 action, expected validator improvement, replay result, fallback decision에 연결하는 evidence log가 필요하다.이러한 log는 replay, visual ablation, counterfactual testing, permission control, simulator 또는 emulator guard, human review, failure attribution을 가능하게 한다.
8 한계
이 survey는 가용 연구의 불완전한 포괄성과 도메인 간 보편적으로 비교 가능한 평가의 부재로 제한된다. 따라서 결정적인 분야 경계나 보편적 순위를 제시하기보다 정리 taxnomy를 제시한다.
- 8 한계: 포괄 범위는 publicly available 논문, benchmark, repository로 한정되므로 최근 system, closed-source deployment, domain-specific tool이 누락될 수 있다.이 survey는 benchmark를 제안하는 연구를 과대 대표하고, 공개 artifact가 없는 deployed system을 과소 대표할 수 있다.
- 8 한계: 서로 다른 benchmark는 correctness의 서로 다른 단면을 관찰하므로 method 간 비교가 제한되고 보편적 순위를 매길 수 없다.대신 이 survey는 도메인 내 비교, 공통 failure mode, leakage, benchmark saturation, judge sensitivity와 같은 reliability risk를 강조한다.
- 8 한계: Cross-task transfer에 대한 논의는 agenda-setting 성격을 지닌다. 현재의 평가는 causal transfer를 분리해 검증하는 경우가 드물고 deployment를 지향하는 우려를 충분히 탐구하지 않기 때문이다.이 한계는 deployed setting에서 transferable visual-code capability에 관한 결론을 제약한다.
9 광범위한 영향
Multimodal code intelligence는 visual programming과 실행 가능한 artifact 수정을 더 쉽게 만들 수 있지만, 시각적으로 그럴듯한 출력은 심각한 오류를 감출 수 있다. Agentic deployment는 privacy, security, safety 위험도 높이므로 provenance, permissions, logging, validation, human oversight가 필요하다.
- 9 광범위한 영향: Multimodal code intelligence는 screenshot, diagram, sketch, video 또는 자연어를 interface, chart, document, SVG, CAD, robot policy용 code로 변환해 visual programming의 진입 장벽을 낮춘다.또한 전문가가 visual feedback을 실행 가능한 수정으로 전환하도록 도와 artifact를 더 쉽게 검사하고, 편집하고, 재사용하게 할 수 있다.
- 9 광범위한 영향: 시각적으로 그럴듯한 출력은 잘못된 chart data를 비롯한 심각한 오류를 감출 수 있으므로, 외관만으로는 correctness의 충분한 증거가 되지 않는다.
- 9 광범위한 영향: Agentic system은 browser, file, API, design tool, proprietary repository 또는 robot을 조작할 때 privacy 및 safety 위험을 초래한다.Screenshot과 design file은 private information을 노출할 수 있고, 생성된 code는 proprietary context에서 유출되거나 악용될 수 있으며, embodied policy는 simulation 밖에서 다르게 동작할 수 있다.
- 9 광범위한 영향: Deployment에서는 generation을 provenance tracking, permission scope, execution log, domain validator 및 high-stakes use case에 대한 human review와 결합해야 한다.
10 결론
이 논문은 네 가지 영역에 걸쳐 Multimodal Code Intelligence를 체계적으로 조사하고, 시각적 인식을 실행 가능한 표현으로 변환하는 벤치마크와 방법론을 검토한다.
- 이 서베이는 Multimodal Code Intelligence를 Graphical User Interface, Scientific Visualization, Structured Graphics, Frontier Tasks and Frameworks의 네 가지 영역으로 구성한다.
- 멀티모달 코드 생성 과제를 위한 기존 벤치마크와 방법론을 폭넓게 검토한다.
- 조사한 방법들은 광범위한 과제에 걸쳐 시각적 인식을 다양한 실행 가능한 표현으로 변환한다.