Source-linked AI summary

Innovator-VL: A Multimodal Large Language Model for Scientific Discovery

Zichen Wen, Boxue Yang, Shuang Chen, Yaojie Zhang, Yuhang Han, Junlong Ke, Cong Wang, Yicheng Fu, Jiawang Zhao, Jiangchao Yao, Xi Fang, Zhen Wang, Henxing Cai, Lin Yao, Zhifeng Gao, Yanhui Hong, Nang Yuan, Yixuan Li, Guojiang Zhao, Haoyi Tao, Nan Wang, Han Lyu, Guolin Ke, Ning Liao, Xiaoxing Wang, Kai Chen, Zhiyu Li, Feiyu Xiong, Sihan Hu, Kun Chen, Yanfeng Wang, Weinan E, Linfeng Zhang, Linfeng Zhang

arXiv:2601.19325v1cs.CVcs.AI

TL;DR

과학 멀티모달 태스크는 여전히 어렵고, 기존 접근법은 값비싼 특화 데이터와 불투명한 파이프라인에 의존하는 경우가 많다. Innovator-VL은 투명하고 재현 가능한 training framework를 도입해 37개 benchmark에서 61.83%를 달성했으며, 비슷한 규모의 비교 모델을 능가한다.

  • 문제

    기존 멀티모달 모델, 특히 open-source 시스템은 까다로운 과학 태스크에서 여전히 어려움을 겪으며, 많은 접근법이 재현성을 제한하는 값비싼 특화 데이터와 불투명한 파이프라인을 요구한다.

  • 방법

    Innovator-VL은 data efficiency, reproducibility, balanced generalization을 강조하는 원칙 기반의 완전 투명한 end-to-end reproducible training framework를 사용한다.

  • 결과

    37개 benchmark에서 평균 61.83%를 기록한 Innovator-VL-8B-Thinking은 general, mathematical, scientific domain을 아우르는 비슷한 규모의 비교 모델 가운데 SOTA 성능을 달성한다.

  • 시사점 및 한계

    투명하고 재현 가능한 recipe는 과학 멀티모달 모델에 대한 커뮤니티의 후속 탐색을 위한 foundation을 제공한다.

  • 시사점 및 한계

    과학 fine-tuning 데이터는 현재 진행 중인 data compliance 검토로 인해 아직 공개되지 않았다.

Abstract

from arXiv · show

We present Innovator-VL, a scientific multimodal large language model designed to advance understanding and reasoning across diverse scientific domains while maintaining excellent performance on general vision tasks. Contrary to the trend of relying on massive domain-specific pretraining and opaque pipelines, our work demonstrates that principled training design and transparent methodology can yield strong scientific intelligence with substantially reduced data requirements. (i) First, we provide a fully transparent, end-to-end reproducible training pipeline, covering data collection, cleaning, preprocessing, supervised fine-tuning, reinforcement learning, and evaluation, along with detailed optimization recipes. This facilitates systematic extension by the community. (ii) Second, Innovator-VL exhibits remarkable data efficiency, achieving competitive performance on various scientific tasks using fewer than five million curated samples without large-scale pretraining. These results highlight that effective reasoning can be achieved through principled data selection rather than indiscriminate scaling. (iii) Third, Innovator-VL demonstrates strong generalization, achieving competitive performance on general vision, multimodal reasoning, and scientific benchmarks. This indicates that scientific alignment can be integrated into a unified model without compromising general-purpose capabilities. Our practices suggest that efficient, reproducible, and high-performing scientific multimodal models can be built even without large-scale data, providing a practical foundation for future research.

1 서론

과학 멀티모달 과제는 정밀한 모달 간 이해, 다단계 추론, 도메인 지식을 요구하므로 여전히 어렵다. 기존 해법은 비용이 큰 특화 데이터와 불투명한 파이프라인을 필요로 하는 경우가 많다. Innovator-VL은 폭넓은 멀티모달 역량을 유지하면서 이러한 한계를 해결하는 투명하고 재현 가능하며 데이터 효율적인 프레임워크를 제시한다.

  • 과학 과제는 정밀한 이해, 엄밀한 다단계 추론, 모달 간 도메인 지식을 요구하기 때문에 아직 충분히 탐구되지 않았으며 특히 어렵다 [Zhang et al., 2023].
  • 기존 과학 멀티모달 접근법은 가능성을 보이지만 대규모 또는 고도로 특화된 데이터셋에 의존하는 경우가 많아 재현성과 접근성이 제한된다.
  • Innovator-VL은 데이터 효율성, 재현성, 균형 잡힌 일반화를 향상하도록 설계된 완전히 투명하고 엔드투엔드로 재현 가능한 학습 프레임워크를 도입한다.
  • Innovator-VL은 대규모 과학 분야 사전학습 없이 오백만 개 미만의 엄선된 과학 샘플을 사용해 다양한 과학 과제에서 경쟁력 있는 성능을 달성한다.
  • Innovator-VL은 또한 유사한 규모의 모델 가운데 범용 비전, 멀티모달 추론, 과학 벤치마크에서 경쟁력 있는 성능을 보이며, 범용 역량을 저해하지 않는다.

2 모델 아키텍처

Innovator-VL은 region-aware visual representation, token compression, scientific reasoning language model을 통합한 three-stage vision encoder–projector–language model 아키텍처를 사용한다.

  • 2 모델 아키텍처: Innovator-VL은 visual modality와 textual modality를 연결하기 위해 three-stage vision encoder–projector–language model 아키텍처를 따른다.
  • 2 모델 아키텍처: RICE-ViT는 단일 forward pass에서 특화된 Region Transformer layer를 통해 전체적이고 국소적인 visual cue를 포착한다.이는 region-aware representation learning을 위해 설계되었으며, 주로 global patch interaction에 초점을 맞추는 CLIP [Radford et al., 2021] 및 SigLIP [Zhai et al., 2023, Tschannen et al., 2025]와 대조된다.
  • 2 모델 아키텍처: PatchMerger는 다수의 Vision Transformer patch embedding을 더 적은 수의 representative token으로 압축하는 방법을 학습하여 downstream sequence length, computational complexity, memory usage를 줄인다.이 모듈은 dense visual token 처리의 quadratic cost를 해결한다.
  • 2 모델 아키텍처: Qwen3-8B-Base [Yang et al., 2025a]는 scientific multimodal task를 위한 Innovator-VL의 language modeling 및 reasoning component로 사용된다.강점으로는 STEM, logical reasoning, long-context understanding과 함께 open-source 제공 및 성숙한 tooling 지원이 있다.

3 사전 학습

Innovator-VL은 두 단계의 멀티모달 사전 학습을 사용한다. 먼저 projector 기반 language-image alignment를 수행하고, 이어서 모든 parameter를 학습하는 고품질 mid-training을 진행한다. 이 설계는 추가적인 scientific-text 사전 학습을 배제하고, 폭넓은 시각 능력을 유지하면서 효율적인 지식 주입을 강조한다.

  • 3 사전 학습: 사전 학습은 language-image alignment에 이어 모든 모듈을 대상으로 full-parameter training을 수행하는 고품질 mid-training으로 구성된다.첫 번째 단계에서는 projector를 학습하고, 두 번째 단계에서는 새로운 지식을 효율적으로 주입하기 위해 모든 모듈을 업데이트한다.
  • 3 사전 학습: alignment 단계에서는 LLaVA-1.5 558k [Liu et al., 2024b]를 사용해 projector를 학습하고, 시각 특징을 LLM의 word-embedding 공간으로 매핑한다.
  • 3 사전 학습: mid-training 단계에서는 LLaVA-OneVision-1.5-Mid-Training [An et al., 2025]에서 수집한 약 85 million개의 고품질 이미지-텍스트 쌍을 사용하며, English 샘플 65 million개와 Chinese 샘플 20 million개를 포함한다.
  • 3 사전 학습: 저자들은 Qwen3-8B-Base가 이미 상당한 scientific knowledge를 흡수했으며, 부족한 고품질 데이터가 domain bias와 overfitting을 유발할 수 있기 때문에 continued scientific-text pre-training을 생략한다.이 선택은 견고한 시각적 이해에 기반한 general capabilities를 유지하는 데에도 기여한다.

4 Post-training

Innovator-VL은 instruction following, multistep reasoning, scientific multimodal reasoning을 향상하기 위해 staged supervised fine-tuning과 reinforcement learning을 사용한다. Post-training은 다양한 instructional 및 scientific data를 discrepancy-guided RL selection, sequence-level optimization과 결합하지만, 참조된 버전은 compliance review로 인해 공개되지 않았다.

  • 4 Post-training: Staged post-training은 instruction following, multistep reasoning, scientific multimodal reasoning을 향상하기 위해 supervised fine-tuning과 reinforcement learning을 결합한다.목표는 general visual instruction following, complex reasoning, scientific problem solving을 아우른다.
  • Limitations: 참조된 high-quality scientific corpus 버전은 data compliance review 절차가 진행 중이기 때문에 공개되지 않았다.이로 인해 해당 corpus 버전에 즉시 공개적으로 접근하기 어렵다.
  • Supervised Fine-tuning: SFT는 general multimodal instructions, chain-of-thought and multistep reasoning annotations, scientific understanding data를 사용해 complex scientific reasoning을 지원한다.General instruction data는 captioning, charts and tables, code and mathematics, VQA, grounding and counting, OCR을 포함한 범주를 다룬다.
  • Scientific Data Construction: Scientific training data는 in-the-wild OCSR, literature-based reaction understanding, electron-micrograph characterization 전반의 체계적인 quality control을 강조하는 domain-specific pipelines로 구축된다.이 pipelines는 OCSR에 synthetic bootstrapping과 active learning을 사용하고, hierarchical PDF-based reaction benchmarks와 dense segmentation 및 structured descriptions를 포함한 cleaned EM data를 활용한다.
  • Reinforcement Learning: RL training은 Innovator-VL-RL-172K를 사용하며, Pass@N–Pass@1 discrepancy analysis와 reward-based filtering을 통해 medium-difficulty samples를 선별한 뒤 reasoning formats를 표준화한다.이 corpus는 textual structures와 stepwise outputs를 정규화해 heterogeneous sources 간 training instability를 줄인다.
  • Reinforcement Learning: GSPO는 importance sampling과 clipping을 sequence-level rewards에 맞춰 token-level mismatch를 줄이고, long-context reasoning을 위한 견고하고 효율적인 RL convergence를 지원한다.그 objective는 length-normalized sequence likelihood ratios를 사용하는 sequence-level trust region 아래에서 group response rewards를 최대화한다.

5 인프라

Innovator-VL은 pre-training, supervised fine-tuning, asynchronous reinforcement learning을 아우르는 최적화된 distributed training pipeline을 사용한다. Transformer 수준의 최적화, offline data packing, decoupled rollout-learning을 통해 계산 및 학습 효율을 높인다.

  • 5 인프라: pre-training 및 SFT pipeline은 Megatron-LM [Shoeybi et al., 2019]에서 파생된 AIAK-Training-LLM을 사용하며, mixed-precision 가속, distributed optimizer parallelism, selective activation recomputation을 지원한다.AIAK-Training-LLM은 Baidu Cloud가 제공하는 enterprise-grade Megatron-LM 최적화로 설명된다.
  • 5 인프라: Offline data packing은 multimodal data layout을 사전 최적화해 padding overhead를 줄이고, context-window 활용도, GPU 활용도, training throughput, 계산 효율을 높인다 [An et al., 2025].이 전략은 LLaVA-OneVision-1.5 [An et al., 2025]를 따르며, 가변 sequence length에서 발생하는 중복을 해결한다.
  • 5 인프라: AReaL [Fu et al., 2025]은 non-blocking producer-consumer architecture에서 rollout과 learning을 decoupling해 synchronous reinforcement-learning 병목을 해결한다.이 framework는 전용 inference worker가 rollout data를 지속적으로 생성하는 동안 learning이 별도로 진행되도록 한다.

6 평가

Innovator-VL은 일반, 수학, 과학 분야의 37개 benchmark에서 비슷한 규모의 multimodal model과 비교 평가된다. Innovator-VL-8B-Thinking은 전체 평균에서 최고 성능을 달성하며, Instruct와 Thinking variant는 일반, reasoning, 과학, 효율성 평가에서 모두 강한 성능을 보인다.

  • 평가 설정: 평가는 일반, math & reasoning, science 차원으로 묶은 대표적인 multimodal benchmark를 사용하며, lmms-eval에서 deterministic decoding을 적용한다.Innovator-VL은 temperature 0.0과 top-p 1.0을 사용해 비슷한 규모의 7B–9B state-of-the-art multimodal model과 비교된다.
  • 종합 평가: 37개 benchmark에서 61.83%의 평균을 기록한 Innovator-VL-8B-Thinking은 SOTA를 달성하며, 비슷한 규모의 모든 비교 모델을 능가한다.평가는 일반, 수학, 과학 영역을 아우른다.
  • Reasoning 효율성: Innovator-VL-8B-Thinking은 MiMo-VL-7B-RL보다 1.4×–2×, Intern-S1-mini보다 3.9×–4.3× 높은 accuracy-to-token ratio를 달성한다.Figure 5는 이러한 효율성 향상과 함께 훨씬 짧은 reasoning chain을 보고한다.
  • 일반 Vision: Innovator-VL-8B-Instruct는 74.50%의 평균으로 74.71%를 기록한 Qwen3-VL-8B와 비슷한 성능을 보이며, AI2D와 RealWorldQA에서 best results를 달성한다.또한 MME-RealWorld에서 우수한 scene understanding을 보이며 InternVL3.5-8B와 LLaVA-OV-1.5-8B를 크게 능가한다.
  • Math & Reasoning: Innovator-VL-8B-Thinking은 55.41%의 평균으로 Math & Reasoning에서 SOTA를 달성하며, Innovator-VL-8B-Instruct보다 4.54 percentage points 향상된다.이러한 향상은 complex reasoning 성능을 높이는 reinforcement learning에 기인한다.
  • Science: Innovator-VL은 Science category 평균에서 50.13%와 49.79%로 상위 두 성적을 확보하며, OpenRxn에서 57%, MolParse에서 64%를 초과한다.다른 모든 baseline은 OpenRxn과 MolParse에서 17% 미만에 머문다.

7 추론 토큰 효율성

Innovator-VL-8B-Thinking은 Intern-S1-mini [Bai et al., 2025b] 및 MiMo-VL-7B-RL [Xiaomi, 2025]보다 더 높은 정확도-토큰 비율을 달성하면서 더 적은 토큰으로 더 효율적으로 추론한다. 이러한 효율성은 중복 추론 단계를 제거해 정확성과 간결성을 공동 최적화하는 reinforcement learning에서 비롯된다.

  • 토큰 사용량: Innovator-VL-8B-Thinking은 세 가지 benchmark에서 Intern-S1-mini [Bai et al., 2025b]보다 약 62% to 66% 적은 토큰을, MiMo-VL-7B-RL [Xiaomi, 2025]보다 18% to 48% 적은 토큰을 사용한다.Figure 5 (a)는 reasoning-token 비교를 보고한다.
  • 추론 효율성: Innovator-VL-8B-Thinking은 모든 benchmark에서 MiMo-VL-7B-RL [Xiaomi, 2025]보다 약 1.4× to 2× 높은 정확도-토큰 비율을, Intern-S1-mini [Bai et al., 2025b]보다 3.9× to 4.3× 높은 비율을 달성한다.더 높은 정확도-토큰 비율은 각 토큰이 중복되거나 관련 없는 내용이 아니라 더 유용한 정보를 산출한다는 의미다.
  • 효율성 메커니즘: Reinforcement learning은 정확성과 간결성을 공동 최적화해, 모델이 핵심 추론 단계를 식별하고 중복 계산을 우회하도록 학습시킨다.그 결과 형성된 compact reasoning pathway는 inference 비용을 줄이고 scientific application에서 오류 누적을 제한할 수 있다.

8 결론 및 향후 연구

Innovator-VL은 완전히 투명하고 재현 가능한 training pipeline을 통해 다양한 과학 분야에서 강력한 성능을 달성하면서도 뛰어난 general vision 역량을 유지한다. 이 연구는 신중하게 선별한 5백만 개 미만의 samples만으로도 경쟁력 있는 과학적 추론을 달성할 수 있음을 보여준다.

  • 결론: Innovator-VL은 뛰어난 general vision 역량을 유지하면서 다양한 과학 분야에서 강력한 성능을 달성한다.이 model은 과학적 multimodal large language model로 제시된다.
  • 결론: 완전히 투명하고 재현 가능한 training pipeline이 Innovator-VL의 과학적 multimodal intelligence를 뒷받침한다.
  • 결론: 신중하게 선별한 5백만 개 미만의 samples만으로도 경쟁력 있는 과학적 추론을 달성할 수 있다.결론에서는 이를 과학적 multimodal intelligence를 구축하기 위한 핵심 원칙으로 제시한다.

추가 결과 · A.1 정성적 사례 연구

정성적 사례 연구에서는 동일한 설정에서 baseline 모델이 실패하는 반면 Innovator-VL은 정답을 제시하는 대표 평가 사례를 보여주며, 검토를 위해 전체 응답과 관련 시각 입력을 함께 보고한다.

  • A.1 정성적 사례 연구: 이 연구는 평가 벤치마크에서 선별한 대표 사례를 사용해 종합 벤치마크 점수를 넘어서는 실질적 강점을 보여준다.이 사례들은 논문에서 보고한 종합 성능을 보완한다.
  • A.1 정성적 사례 연구: 제시된 모든 사례에서 학습된 모델은 평가 설정에 맞는 정답을 생성한다.
  • A.1 정성적 사례 연구: 다른 baseline 모델은 동일한 사례와 동일한 평가 조건에서 실패한다.
  • A.1 정성적 사례 연구: 이 사례들은 서로 무관한 예시로 제시된 것이 아니라 평가 벤치마크에서 추출되었다.
  • A.1 정성적 사례 연구: 각 사례에는 해당하는 경우 원래 질문과 관련 이미지 또는 figure가 함께 제시된다.
  • A.1 정성적 사례 연구: 모델의 능력이 과제 요구사항과 어떻게 부합하는지 드러내기 위해 전체 모델 응답을 포함한다.

A.1.1 일반 시각 과제 … Qwen3-VL-8B

제시된 예시는 일반 시각 인식, 시각적 개수 세기와 방향 추론, 과학적 분자 표현을 아우른다. 응답은 추론의 상세도와 정확성이 서로 다르며, E-SMILES 예시는 빈 확장자를 포함한 표준 SMILES를 식별한다.

  • A.1.1 일반 시각 과제: 시각 과제 예시는 모델에 핸드백과 시계의 색상을 식별하고, 방향을 판단하며, 자전거를 탄 사람이 파란 배낭을 메고 있다고 보고하도록 요구한다.이러한 프롬프트는 선택지 문자나 단일 단어/숫자를 포함해 시각 입력에서 직접 답을 도출하도록 요구한다.
  • Innovator-VL-8B-Thinking: Innovator-VL-8B-Thinking은 리본에서 2개, 치마에서 1개, 발에서 2개의 삼각형을 식별해 삼각형 5개를 센다.단계별 분석에서는 식별된 삼각형을 합산하기 전에 리본, 드레스, 몸통, 발을 구분한다.
  • MiniCPM-V4.5 (8B): MiniCPM-V4.5 (8B)는 분홍색 리본과 초록색 드레스의 아래쪽에 해당하는 삼각형 2개를 센다.얼굴 특징, 팔다리, 벨트, 머리카락은 삼각형 수에서 제외한다.
  • InternVL3.5-8B: InternVL3.5-8B는 리본, 드레스 상의, 치마, 팔, 다리, 발을 포함해 삼각형 10개를 센다.응답은 이러한 구성 요소를 반복해서 2 + 1 + 1 + 2 + 2 + 2 = 10으로 합산한다.
  • MiMo-VL-7B-RL: MiMo-VL-7B-RL도 식별한 좌우 방향과 참새별 개수에 근거해 휘슬 총 8회를 보고한다.참새 1과 3은 왼쪽을 보고, 참새 2, 4, 5는 오른쪽을 본다고 진술한 뒤, 모두 8회 휘슬을 분다고 결론짓는다.
  • A.1.3 과학 과제; Case 1: 과학 과제는 Extended SMILES 표현을 요구하며, 그 형식은 RDKit-compatible SMILES 문자열, <sep> 구분자, 구조화된 확장 주석을 결합한다.확장자는 <a>, <r>, <c> 태그를 사용해 원자, 고리, 추상 반복 고리 위치에 주석을 달 수 있으며, <dum>은 연결 지점을 표시한다.
  • SMILES String; E-SMILES; Intern-S1-mini (9B): 주어진 분자에 대해 InternVL3.5-8B는 SMILES CN1N=C2CCCC2=C1C(=O)N1CCN(C(=O)[C@@H]2C[C@H]2[N+](=O)[O-])CC1을 제시한 뒤 빈 확장자를 덧붙인다.명시적 치환기나 추상 고리에 추가 주석이 필요하지 않다고 결론짓는 한편, Intern-S1-mini (9B)는 다른 SMILES 변형을 제시하고 확장 토큰 추가를 논의한다.

Intern-S1-mini (9B) … MiMo-VL-7B-RL

이 절은 분자 구조, 유기 반응, 화학적 변환, 현미경, 분광학, RNA, 천문학, transient 분류, 온도 이상, 조석 amphidromy를 아우르는 multimodal 답변을 제시한다. 또한 White Sea amphidromy 질문에 대한 모델 출력의 차이를 기록하며, Qwen3-VL-8B와 MiMo-VL-7B-RL은 북쪽 구역을 식별한다.

  • Intern-S1-mini (9B): q2 이미지의 화합물은 ESMILES 문자열 COC(=O)C1=C(I)C=CC2=C1OC(C(=O)O)C=C2로 표현된다.이 문자열은 q2 이미지에 표시된 화합물의 구조로 명시적으로 식별된다.
  • Case 3: Scheme 4는 네 가지 derivatization 경로를 통해 2-boryl-1,3-diene 2f를 deborylated product 3, arylated product 4, unsaturated ketone 5, allylic alcohol 6으로 변환한다.보고된 수율은 각각 54%, 74%, 54%, 40%이며, 높은 Z:E 또는 E:Z 선택성이 제시된다.
  • Case 4: 반응 질문은 phenylacetylene과 N-oxide imine 1이 Cu 촉매하에서 반응해 four-membered-ring compound 3을 형성하는 상황을 설명하며, 선택지에는 Et3N 또는 pyridine이 제시된다.다른 선택지는 Et3N과 함께 bridged-ring compound 3이 형성된다고 설명한다.
  • Case 5; Case 6; Case 7: 제공된 질문은 electron microscopy에서 입자 면적의 균일성, MS/MS isotope pattern을 이용한 황 원자 수 계산, 그리고 hairpin, interior, bulge loop를 포함할 수 있는 RNA secondary structure도 다룬다.현미경 기준은 최대 직경과 최소 직경의 평균 비율이 30%를 초과할 때 비균일하다고 정의한다.
  • Case 8; Case 9; Case 10: 추가 multimodal 질문은 galaxy morphology, multi-band light-curve 유형, 전 지구 표면 온도 이상이 가장 높거나 낮은 대략적 지역을 묻는다.은하 선택지에는 막대가 없는 조밀하거나 느슨한 나선은하, 시가형의 매끈한 은하, 팽대부가 없는 edge-on 은하가 포함되며, light-curve 선택지에는 KN, SNII, SNIbc가 포함된다.
  • Qwen3-VL-8B; MiMo-VL-7B-RL: Qwen3-VL-8B는 중심점에서 위상 등고선이 방사형으로 증가한다는 점을 근거로 북쪽 구역 답변을 설명하며, MiMo-VL-7B-RL도 위상선이 그곳으로 수렴하기 때문에 그러한 결과가 나온다고 설명한다.두 설명 모두 이 패턴이 degenerate amphidromy를 나타낸다고 규정한다.

B 평가 세부사항 … 생성

평가는 다양한 multimodal, scientific, mathematical, chemistry 및 real-world vision benchmark를 다루며, task-specific prompt를 통해 간결한 답변 형식, exact matching 또는 structured reasoning을 요구한다. 또한 molecular description, SMILES, chemical reaction 및 land-use classification에 걸친 generation과 property-prediction task도 포함한다.

  • B.2 평가 Prompt: 평가 prompt는 option letter, 단일 단어 또는 구, exact match, <think>/<answer> tag로 감싼 step-by-step reasoning, JSON response 등 task에 맞는 출력을 요구한다.prompt는 image-grounded question, multiple-choice format, hint, English 및 Chinese variant, benchmark별 instruction도 지원한다.
  • ClinTox: ClinTox는 분자가 clinical toxicity를 유발하는지 묻고, 엄격한 “Yes” 또는 “No” prediction을 요구한다.prompt는 molecular input을 받아 binary clinical-toxicity prediction을 반환한다.
  • Side Effect: Side Effect 평가는 binary side-effect prediction과 molecular structure로부터 aqueous-solubility 및 lipophilicity를 수치로 추정하는 과제를 포함한다.prompt는 logSol을 floating-point value로, logP를 numerical value만으로 출력하도록 요구한다.
  • Forward Synthesis: Forward Synthesis는 text-only chemical output을 사용해 reaction-product prediction, retrosynthesis, SMILES–IUPAC conversion 및 molecular-formula determination을 평가한다.출력은 추가 설명 없이 product SMILES, reactant SMILES, IUPAC name 또는 molecular formula로 제한된다.
  • IUPAC to Molecular Formula: IUPAC to Molecular Formula는 IUPAC molecular name을 molecular formula로 변환하고, formula만 출력하도록 요구한다.prompt는 input name을 제공하며 explanation이나 추가 text를 명시적으로 제외한다.
  • Captioning: Captioning은 제공된 input으로부터 분자의 structure와 chemical classification을 상세히 설명하도록 model에 요구한다.이 task는 open-ended이며 detailed structural and chemical description을 요청한다.
  • Generation: Generation은 molecule-description-to-SMILES generation과 하나 또는 여러 개의 정답 선택지를 갖는 image-based land-use classification을 포함한다.land-use prompt는 land-use classification이 있는 설정과 없는 설정을 구분하며, answer letter를 요구하고 여러 선택지는 공백으로 구분한다.
Loading 2601.19325v1…