Source-linked AI summary

Kimi K2.5: Visual Agentic Intelligence

Kimi Team, Tongtong Bai, Yifan Bai, Yiping Bao, S. H. Cai, Yuan Cao, Ziwei Chai, Y. Charles, H. S. Che, Cheng Chen, Guanduo Chen, Huarong Chen, Jia Chen, Jianlong Chen, Jun Chen, Kefan Chen, Liang Chen, Ruijue Chen, Xinhao Chen, Yanru Chen, Yanxu Chen, Yicun Chen, Yimin Chen, Yingjiang Chen, Yuankun Chen, Yujie Chen, Yutian Chen, Zhirong Chen, Ziwei Chen, Dazhi Cheng, Yean Cheng, Minghan Chu, Jialei Cui, Jiaqi Deng, Muxi Diao, Hao Ding, Mengfan Dong, Mengnan Dong, Yuxin Dong, Yuhao Dong, Angang Du, Chenzhuang Du, Dikang Du, Lingxiao Du, Yulun Du, Yu Fan, Shengjun Fang, Qiulin Feng, Yichen Feng, Garimugai Fu, Kelin Fu, Hongcheng Gao, Tong Gao, Yuyao Ge, Shangyi Geng, Chengyang Gong, Xiaochen Gong, Zhuoma Gongque, Qizheng Gu, Xinran Gu, Yicheng Gu, Longyu Guan, Shuhao Guan, Yuanying Guo, Xiaoru Hao, Dailan He, Tianhong He, Weiran He, Wenyang He, Yibo He, Yunjia He, Chao Hong, Hao Hu, Jiaxi Hu, Yangyang Hu, Zhenxing Hu, Ke Huang, Ruiyuan Huang, Weixiao Huang, Zhiqi Huang, Chaobo Jia, Tao Jiang, Zhejun Jiang, Xinyi Jin, Yu Jing, Guokun Lai, Aidi Li, C. Li, Cheng Li, Fang Li, Guanghe Li, Guanyu Li, Haitao Li, Haoyang Li, Jia Li, Jingwei Li, Junxiong Li, Lincan Li, Mo Li, Weihong Li, Wentao Li, Xinhang Li, Xinhao Li, Yang Li, Yanhao Li, Yiwei Li, Yuxiao Li, Zhaowei Li, Zhaoxi Li, Zheming Li, Weilong Liao, Jiawei Lin, Xiaohan Lin, Yibo Lin, Zhishan Lin, Zichao Lin, Cheng Liu, Chenyu Liu, Hongzhang Liu, Liang Liu, Shaowei Liu, Shudong Liu, Shuran Liu, Tianwei Liu, Tianyu Liu, Weizhou Liu, Xiangyan Liu, Yangyang Liu, Yanming Liu, Yibo Liu, Yuanxin Liu, Zhengying Liu, Zhongnuo Liu, Enzhe Lu, Haoyu Lu, Zhiyuan Lu, G. Luo, Junyu Luo, Tongxu Luo, Yashuo Luo, Long Ma, Shaoguang Mao, Yuan Mei, Xin Men, Fanqing Meng, Zhiyong Meng, Yibo Miao, Minqing Ni, Kun Ouyang, Siyuan Pan, Bo Pang, Yuchao Qian, Ruoyu Qin, Zeyu Qin, Jiezhong Qiu, Bowen Qu, Zeyu Shang, Youbo Shao, Tianxiao Shen, Zhennan Shen, Juanfeng Shi, Lidong Shi, Shengyuan Shi, Feifan Song, Pengwei Song, Tianhui Song, Xiaoxi Song, Hongjin Su, Jianlin Su, Zhaochen Su, Lin Sui, Jinsong Sun, Junyao Sun, Tongyu Sun, Flood Sung, Yunpeng Tai, Chuning Tang, Heyi Tang, Xiaojuan Tang, Zhengyang Tang, Jiawen Tao, Shiyuan Teng, Chaoran Tian, Pengfei Tian, Bowen Wang, Chensi Wang, Chuang Wang, Congcong Wang, Dingkun Wang, Dinglu Wang, Dongliang Wang, Feng Wang, Hailong Wang, Haiming Wang, Hao Wang, Hengzhi Wang, Huaqing Wang, Hui Wang, Jiahao Wang, Jinhong Wang, Jiuzheng Wang, Kaixin Wang, Linian Wang, Qibin Wang, Shengjie Wang, Shuyi Wang, Si Wang, Wei Wang, Xiaochen Wang, Xinyuan Wang, Yao Wang, Yejie Wang, Yipu Wang, Yiqin Wang, Yucheng Wang, Yuzhi Wang, Zhaoji Wang, Zhaowei Wang, Zhengtao Wang, Zhexu Wang, Zifan Wang, Zihan Wang, Zizhe Wang, Chu Wei, Ming Wei, Chuan Wen, Zichen Wen, Chengjie Wu, Haoning Wu, Junyan Wu, Rucong Wu, Wenhao Wu, Yuefeng Wu, Yuhao Wu, Yuxin Wu, Zijian Wu, Chenjun Xiao, Jin Xie, Xiaotong Xie, Yuchong Xie, Bowei Xing, Boyu Xu, Jianfan Xu, Jing Xu, Jinjing Xu, L. H. Xu, Lin Xu, Suting Xu, Weixin Xu, Xinbo Xu, Xinran Xu, Yangchuan Xu, Yichang Xu, Yuemeng Xu, Zelai Xu, Ziyao Xu, Junjie Yan, Yuzi Yan, Guangyao Yang, Hao Yang, Junwei Yang, Kai Yang, Ningyuan Yang, Xiaofei Yang, Xinlong Yang, Xinyu Yang, Ying Yang, Yi Yang, Yi Yang, Zhen Yang, Zhilin Yang, Zonghan Yang, Haotian Yao, Dan Ye, Haoran Ye, Wenjie Ye, Zhuorui Ye, Peng Yebo, Bohong Yin, Chengzhen Yu, Longhui Yu, Tao Yu, Tianxiang Yu, Enming Yuan, Mengjie Yuan, Xiaokun Yuan, Yang Yue, Weihao Zeng, Dunyuan Zha, Haobing Zhan, Dehao Zhang, Hao Zhang, Jin Zhang, Puqi Zhang, Qiao Zhang, Rui Zhang, Xiaobin Zhang, Xiaoyun Zhang, Y. Zhang, Yadong Zhang, Yangkun Zhang, Yichi Zhang, Yizhi Zhang, Yongting Zhang, Yu Zhang, Yushun Zhang, Yutao Zhang, Yutong Zhang, Zheng Zhang, Chenguang Zhao, Feifan Zhao, Jinxiang Zhao, Shuai Zhao, Xiangyu Zhao, Xuanle Zhao, Yikai Zhao, Zijia Zhao, Huabin Zheng, Ruihan Zheng, Shaojie Zheng, Tengyang Zheng, Junfeng Zhong, Longguang Zhong, Weiming Zhong, M. Zhou, Runjie Zhou, Xinyu Zhou, Zaida Zhou, Jinguo Zhu, Liya Zhu, Xinhao Zhu, Yuxuan Zhu, Zhen Zhu, Jingze Zhuang, Weiyu Zhuang, Ying Zou, Xinxing Zu

arXiv:2602.02276v2cs.CLcs.AIcs.LG

TL;DR

Multimodal agentic system은 효과적인 vision–text 학습과 순차 실행의 한계에 관한 문제에 직면한다. Kimi K2.5는 text와 vision을 공동 최적화하고 병렬 task decomposition을 위한 Agent Swarm을 도입해 agentic 및 기타 benchmark 전반에서 state-of-the-art 성능을 달성하는 동시에 latency를 줄인다.

  • 문제

    기존 agentic model은 inference time이 선형적으로 증가하는 sequential tool execution에 의존하며, 고정된 vision–text budget에서의 multimodal training strategy는 여전히 미해결 설계 문제다.

  • 방법

    Kimi K2.5는 text와 vision을 공동 최적화하고 reinforcement-learned orchestration을 적용한 Agent Swarm으로 heterogeneous task를 동시에 실행되는 sub-problem으로 분해한다.

  • 결과

    Kimi K2.5는 coding, vision, reasoning, agentic benchmark 전반에서 state-of-the-art 성능을 달성하며, Discard-all context management를 적용한 BrowseComp에서 74.9%를 기록한다.

  • 시사점 및 한계

    Joint vision–text intelligence와 parallel agent execution은 복잡한 workload를 위한 scalable, general-purpose agentic system을 지원한다.

Abstract

from arXiv · show

We introduce Kimi K2.5, an open-source multimodal agentic model designed to advance general agentic intelligence. K2.5 emphasizes the joint optimization of text and vision so that two modalities enhance each other. This includes a series of techniques such as joint text-vision pre-training, zero-vision SFT, and joint text-vision reinforcement learning. Building on this multimodal foundation, K2.5 introduces Agent Swarm, a self-directed parallel agent orchestration framework that dynamically decomposes complex tasks into heterogeneous sub-problems and executes them concurrently. Extensive evaluations show that Kimi K2.5 achieves state-of-the-art results across various domains including coding, vision, reasoning, and agentic tasks. Agent Swarm also reduces latency by up to $4.5\times$ over single-agent baselines. We release the post-trained Kimi K2.5 model checkpoint to facilitate future research and real-world applications of agentic intelligence.

1 서론

Kimi K2.5는 text-vision 공동 최적화와 병렬 agent를 동적으로 orchestration하는 framework인 Agent Swarm을 통해 범용 agentic intelligence를 발전시킨다. agentic 및 frontier benchmark 전반에서 강력한 성능을 보이며, state-of-the-art visual-to-code와 내부 software-engineering 평가를 포함한다.

  • Text와 Vision의 공동 최적화: Kimi K2.5는 text와 vision을 공동 최적화하며, 고정된 총 token budget에서 낮은 비율의 초기 vision fusion이 후기 visual-token 추가보다 뛰어날 수 있음을 확인한다.논문은 joint text-vision optimization이 두 modality를 모두 향상시키면서 충돌을 방지한다고 제시한다.
  • Text와 Vision의 공동 최적화: Architecture 측면에서 MoonViT-3D는 native-resolution variable-resolution image processing과 경량 temporal compression을 결합해 video understanding을 수행한다.이미지에는 NaViT packing을 사용하고, 연속된 video frame을 네 개씩 묶어 patch-level temporal averaging을 수행한다.
  • Text와 Vision의 공동 최적화: Text-only SFT는 visual reasoning과 tool use를 활성화하지만, 사람이 설계한 visual trajectory는 generalization을 저해한다. 이후 joint reinforcement learning이 text 및 vision task를 포괄한다.보고된 결과는 joint pretraining 과정에서 확립된 강력한 vision-text alignment에 기인한다.
  • 병렬 Agent Orchestration: Kimi K2.5는 Agent Swarm을 도입해 sub-agent creation과 task delegation을 포함하는 Parallel-Agent Reinforcement Learning으로 sequential agent의 latency 및 scalability 한계를 해결한다.이 framework는 verifiable reward로 tool execution을 최적화하며, sub-agent creation과 task delegation을 위한 interface를 통합한다.
  • 개요: Kimi K2.5는 state-of-the-art visual-to-code generation과 강력한 내부 software-engineering 성능을 달성하며, specialized-agent diversity와 parallelism을 확장한다.이 model은 vision과 language, thinking과 instant mode, chat과 agent를 통합하는 unified architecture로 제시된다.

2 텍스트와 비전의 공동 최적화

Kimi K2.5는 대규모 mixed-token 사전학습, zero-vision SFT, outcome-based visual RL, joint multimodal RL을 통해 텍스트와 비전을 공동 최적화한다. 이 접근법은 강건한 시각 능력을 활성화하는 동시에 텍스트 성능도 향상한다.

  • 공동 사전학습: Kimi K2.5는 약 15 trillion개의 mixed visual 및 text token에 대한 공동 사전학습을 통해 Kimi K2를 확장하며, 두 modality를 동시에 향상한다.이 모델은 언어 학습 이후 vision-adapted된 모델이 아니라 본질적으로 multimodal이다.
  • 공동 사전학습: 고정된 전체 vision-text token budget에서 낮은 vision ratio를 사용한 early fusion이 이후의 높은 비율 vision injection보다 우수하다.vision ratio와 injection timing을 달리한 ablation 결과, 통념과 달리 [8] [21] vision ratio는 최종 multimodal 성능에 미치는 영향이 미미한 것으로 나타났다.
  • Zero-Vision SFT: Zero-vision SFT는 text SFT data와 programmatic IPython image operation만으로 visual 및 agentic capability를 활성화한다.이 방법은 다양한 cross-modal reasoning behavior를 지원하며, 예비 실험에서는 text-vision SFT가 visual 및 agentic task에서 훨씬 낮은 성능을 보였다.
  • Multimodal Reinforcement Learning: Outcome-based visual RL은 grounding, chart 및 document understanding, vision-critical STEM task에 대한 학습을 통해 visual input이 무시되는 실패를 교정한다.그 결과 생성된 trajectory는 rejection-sampling fine-tuning과 이후의 더욱 풍부한 multimodal reasoning trace를 지원한다.
  • Multimodal Reinforcement Learning: Outcome-based visual RL 이후 MMLU-Pro에서 84.7% → 86.4%, GPQA-Diamond에서 84.3% → 86.4%, LongBench v2에서 56.7% → 58.9%를 기록한다.Visual RL은 기본적인 visual capability와 복잡한 agentic behavior를 향상하는 동시에 textual performance도 개선했다.

3 Agent Swarm

Agent Swarm은 복잡한 작업을 동적으로 분해하고, 전문화된 subagent를 생성하며, 하위 작업을 병렬로 스케줄링함으로써 순차적 단일 에이전트 실행의 한계를 해결한다. PARL은 오케스트레이션 결정을 학습하고, 효과적이고 실행 가능한 병렬화를 유도하는 보상 및 critical-step 제약을 사용해 학습한다.

  • Agent Swarm: Agent Swarm은 복잡한 작업에서 순차적 추론과 tool calling을 동적 작업 분해, 전문화된 subagent 생성, 병렬 하위 작업 스케줄링으로 대체한다.정보 수집과 다중 분기 추론이 확장되면 순차적 실행은 병목을 일으키며, 단일 에이전트는 실제적인 추론 깊이와 tool-call budget을 소진할 수 있다.
  • PARL 보상 학습: PARL은 병렬화가 항상 유익하다고 가정하지 않고, 환경 피드백을 통해 병렬화 여부, 시점, 방식을 학습한다.보상 설계는 작업 수준의 성능과 함께 직렬 실행으로의 붕괴를 억제하고 유효한 작업 분해를 유도하는 보조 항을 결합한다.
  • 아키텍처 및 학습 설정: PARL은 고정된 intermediate policy checkpoint에서 생성된 frozen subagent를 사용하는 trainable orchestrator로 학습하며, credit-assignment 모호성과 학습 불안정성을 줄이기 위해 end-to-end 공동 최적화를 피한다.이 분리된 아키텍처는 희소하고 잡음이 많은 결과 기반 보상에 대응해 오케스트레이션과 subagent policy를 분리한다.
  • 자원 제약으로서의 Critical Step: Critical step은 가장 오래 실행되는 branch를 기준으로 병렬 실행을 측정하며, 단순히 하위 작업을 더 만드는 대신 최대 실행 시간을 줄이는 균형 잡힌 분해를 장려한다.학습과 평가에 critical step 제약을 적용하면 critical path를 단축하지 않는 과도한 하위 작업 생성은 거의 이점을 제공하지 않는다.
  • 병렬 에이전트 능력 유도를 위한 Prompt 구성: Synthetic prompt는 병렬 에이전트 능력을 유도하기 위해 독립적인 정보원 전반에 대한 폭넓은 검색과, 지연된 aggregation을 수반하는 추론 branch 전반에 대한 심층 검색을 목표로 한다.Prompt suite는 폭넓은 정보 수집과 다중 분기 추론 패턴을 사용해 순차적 agentic 실행에 부담을 준다.

4 방법 개요

Kimi K2.5는 native-resolution multimodal architecture, 단계적 text-vision pre-training, joint multimodal 및 agentic optimization을 위한 post-training methods를 갖춘 Kimi K2 MoE 기반 위에 구축된다. 설계에는 shared image-video representations, token-efficient reinforcement learning, decoupled multimodal training이 포함되며, text-only training 효율의 90%에 도달한다.

  • Architecture: Kimi K2.5는 Kimi K2 MoE language model을 MoonViT-3D vision encoder 및 MLP projector와 결합해 native-resolution multimodal processing을 수행한다.이 architecture는 Kimi-VL [54]에서 확립된 design principles를 따른다.
  • Architecture: MoonViT-3D는 최대 4개의 연속 프레임에서 patch를 하나의 spatiotemporal sequence로 패킹해 image와 video 전반에서 parameter와 embedding space를 공유한다.이를 통해 동일한 attention mechanism이 spatial 및 temporal dimension 전반에서 작동한다.
  • Pre-training: Pre-training은 standalone ViT training, joint text-vision training, 약 15T tokens에 걸친 long-context mid-training으로 진행되며, language 및 multimodal capability를 확장한다.joint stage에서는 4K sequence length에서 추가 vision-text tokens를 사용하고, third stage에서는 더 높은 품질의 data와 long-context activation을 도입한다.
  • Post-training: Post-training은 synthesized instruction data, joint text-vision reinforcement learning, Unified Agentic Reinforcement Learning Environment 내 PARL을 결합한다.instruction-tuning data에는 specialized domain pipelines, human annotation, prompt engineering, multi-stage verification이 사용된다.
  • Training efficiency: text-only training 대비 90% multimodal training efficiency는 vision encoder와 main backbone의 optimization을 분리하면서 load를 균형화하는 DEP를 통해 달성된다.K2.5는 Kimi K2의 parallel strategy를 계승한다.

5 평가

Kimi K2.5는 reasoning, coding, agentic, vision, video, computer-use benchmark에서 proprietary 및 open-source baseline과 비교 평가되며, 이들 영역 전반에서 competitive 또는 state-of-the-art 결과를 달성한다. Agent Swarm은 parallel orchestration을 통해 benchmark 성능을 추가로 높이고 실행 시간을 줄이며 proactive context management를 제공한다.

  • Agentic 역량: Discard-all context management를 적용한 BrowseComp에서 74.9%를 기록해 GPT-5.2의 65.8%를 웃돌며, context management를 사용하지 않을 때 Kimi K2.5는 60.6%를 기록한다.Kimi K2.5는 DeepSearchQA, FinSearchCompT2&T3, Seal-0에서도 평가된 모델 중 선두를 차지한다.
  • 종합 결과: Kimi K2.5는 proprietary 및 open-source baseline과 비교해 reasoning, coding, agentic, vision, video, computer-use benchmark 전반에서 competitive 또는 state-of-the-art performance를 달성한다.Table 4는 이러한 역량 영역 전반의 종합 비교를 요약한다.
  • Computer-Use 역량: GUI action만 사용한 OSWorld-Verified에서 63.3%의 성공률을 기록해 Qwen3-VL-235B-A22B의 38.1%와 Operator의 42.9%를 웃돌며, Claude Opus 4.5의 66.3%에 근접한다.이 결과는 external tool 없이도 강력한 실세계 computer-use 역량을 보인다.
  • Agent Swarm 성능: BrowseComp에서 78.4%를 기록한 Agent Swarm은 single-agent K2.5 대비 17.8% absolute gain을 달성하며 GPT-5.2 Pro의 77.9%를 넘어선다.WideSearch의 Item-F1은 72.7%에서 79.0%로 향상되며, in-house swarm benchmark는 16.7% 상승한다.
  • Parallelism을 통한 실행 시간 절감: 3× ∼4.5× 더 짧은 execution time으로 Agent Swarm은 single-agent baseline보다 빠르게 목표 WideSearch 성능에 도달한다.목표 Item-F1이 30%에서 70%로 증가할수록 task complexity에 따라 efficiency advantage가 확장된다.
  • Proactive Context Management로서의 Agent Swarm: Agent Swarm은 orchestrator 수준의 coherence를 유지하면서 subagent context의 범위를 제한하고 핵심 coordination signal을 보존해 BrowseComp의 efficiency와 accuracy에서 Discard-all을 앞선다.이 proactive context management는 reactive truncation이나 history-discarding strategy와 다르다.

6 결론 · A 기여자 · B 사전 학습

Kimi K2.5는 text–vision 공동 최적화와 병렬 에이전트 실행을 통해 일반 agentic intelligence를 구현하며, 논문에서는 기여자와 vision-to-text 사전 학습 분석도 기록한다.

  • 6 결론: 사전 학습과 reinforcement learning 전반의 text–vision 공동 최적화는 cross-modal alignment와 visual–text reasoning을 제공하며, Agent Swarm은 이기종 하위 작업을 동시에 실행해 지연 시간을 줄이고 복잡한 agentic workload의 성능을 높인다.이러한 메커니즘은 확장 가능하고 일반적인 agentic intelligence를 함께 뒷받침한다.
  • 6 결론: Agent Swarm은 이기종 하위 작업의 병렬 실행을 가능하게 하여 추론 지연 시간을 줄이는 동시에 복잡한 agentic workload의 성능을 높인다.이 framework는 Kimi K2.5의 agentic 설계의 일부로 동시 에이전트 실행을 동적으로 지원한다.
  • A 기여자: 저자들은 성을 기준으로 알파벳순으로 나열되어 있다.기여자 섹션에는 전체 저자 목록과 The University of Hong Kong의 소속을 나타내는 표지가 포함되어 있다.
  • A 기여자: 기여자 목록은 Kimi K2.5 프로젝트의 기여 표기를 포함해 논문의 방대한 저자 명단을 아우른다.목록에는 The University of Hong Kong의 소속을 나타내는 † 표지가 포함되어 있다.
  • B 사전 학습: 고정된 vision–text token budget에서 vision과 language task 전반을 평가할 때, 낮은 vision 비율을 사용한 early fusion이 더 나은 결과를 내는 경향이 있다.Figure 9는 10:90, 20:80, 50:50 vision-to-text 비율을 비교한다.

B.1 Joint-Training … C 인프라

이 연구는 early fusion이 vision을 나중에 도입하는 방식보다 더 안정적인 multimodal training을 제공하며, Kimi K2.5가 확장 가능한 병렬 인프라를 사용해 선별된 text 및 vision corpus로 학습된다는 점을 보인다.

  • B.1 Joint-Training: Early fusion은 더 건강하고 안정적인 text 성능을 유지하는 반면, mid- 및 late-fusion training에서는 vision data 도입 후 text 성능이 일시적으로 저하된다.이러한 저하 후 회복 양상은 modality domain shift가 기존 linguistic representation을 교란하기 때문으로 해석되며, early exposure는 unified representation과 더 원활한 gradient를 지원한다.
  • B.2 Text data: Pre-training text corpus는 Web Text, Code, Mathematics, Knowledge를 포함하며, correctness와 quality validation 및 targeted data experiment를 거친다.대부분의 processing pipeline은 Kimi K2 [53]를 따른다.
  • B.2 Text data: Code data는 repository-level reasoning, 실제 개발 패턴, code 관련 문서에 중점을 두어 복잡한 coding 및 agentic coding 능력을 강화한다.확장된 source에는 cross-file repository, issue, review, commit history, retrieved code document가 포함된다.
  • B.3 Vision data: Multimodal corpus는 modality alignment, long-context comprehension, visual understanding을 위해 caption, interleaving, OCR, knowledge, perception, video, agent data를 포괄한다.Caption data [49] [19]는 synthetic caption에 대한 제한과 함께 alignment를 지원하며, interleaving data [81] [32]는 multi-image comprehension과 더 긴 context를 지원한다.
  • B.3 Vision data: 특화된 multimodal problem-solving corpus는 검색 및 crawling한 정보 자료를 K-12부터 대학 수준까지의 구조화된 학술 문제로 변환하여 STEM reasoning을 대상으로 한다.In-context learning [11]은 명시적인 query 형식이 없는 content를 재구성한다.
  • B.3 Vision data: Agentic 및 temporal understanding data는 GUI screenshots, action trajectories, human demonstrations, 다양한 source의 video, fine-grained grounding annotation을 결합한다.Grounding data에는 bounding box, point-based reference, contour-level annotation이 포함된다.
  • C Infra: Training은 8×400 Gbps RoCE interconnect를 갖춘 H800 GPU cluster에서 수행되며, 16-way pipeline parallelism, 16-way expert parallelism, ZeRO-1 data parallelism을 결합한다.이 전략은 32의 배수인 node 수를 지원하며, interleaved 1F1B scheduling하에서 expert all-to-all communication과 computation을 중첩한다.

C.1 데이터 저장 및 로딩 · D 통합 Agentic Reinforcement Learning 환경 · E 평가 설정

이 논문은 native-format object storage와 유연하고 결정적이며 확장 가능한 데이터 파이프라인을 통해 멀티모달 학습을 지원한다. 통합 Agentic RL 환경은 다양한 태스크를 표준화하고, 특화된 구성 요소를 조합하며, 비동기 rollout을 확장하고, white-box 및 black-box 설정에서의 평가를 지원한다.

  • C.1 데이터 저장 및 로딩: 데이터 인프라는 S3-compatible storage 에 시각 데이터를 native format으로 보존하고, 동적 셔플링, 블렌딩, 토큰화, loss masking, sequence packing을 지원한다.이러한 기능을 통해 학습 요구 사항의 변화에 따라 데이터 비율을 조정할 수 있다.
  • C.1 데이터 저장 및 로딩: 확률적 augmentation은 시각 및 텍스트 modality를 포괄하며, 기하학적 변환 중에도 2D 공간 좌표와 방향 metadata를 보존한다.
  • C.1 데이터 저장 및 로딩: 결정적 seed와 worker-state 관리로 인해 중단된 학습을 중단 없이 실행한 경우와 동일한 데이터 순서로 재개할 수 있다.
  • C.1 데이터 저장 및 로딩: 계층형 캐싱은 분산 클러스터 전반에서 data-loading throughput을 확장하는 동시에 object-storage 요청 빈도를 조절하며, 플랫폼 전체의 dataset 거버넌스와 cloud 간 동기화를 지원한다.또한 이 플랫폼은 등록, 시각화, 통계 분석, lifecycle 거버넌스를 지원한다.
  • D 통합 Agentic Reinforcement Learning 환경: Agentic RL framework는 pluggable toolset, judge, prompt-diversification, instruction-following module을 갖춘 standardized Gym-like interface [10]를 제공한다.이러한 구성 요소는 core agent loop와 동적으로 조합되어 유연한 환경 커스터마이제이션과 모델 일반화를 지원한다.
  • D 통합 Agentic Reinforcement Learning 환경: 최대 100,000개의 동시 agent task가 비동기 coroutine으로 실행되며, 이 coroutine은 sub-task rollout을 재귀적으로 트리거할 수 있어 Parallel-Agent RL과 Agent-as-Judge [31]를 가능하게 한다.Rollout Manager는 partial rollout을 포함한 세밀한 제어를 제공한다.
  • D 통합 Agentic Reinforcement Learning 환경: 기록된 log probability를 사용하는 Token-in-Token-out inference는 train-inference mismatch correction을 지원하며, LLM Gateway는 custom protocol에 따라 black-box rollout 요청과 응답을 기록한다.모니터링, profiling, 시각화, 검증 도구는 고도로 병렬화된 비동기 실행에서 효율성과 정확성을 지원한다.
  • E 평가 설정: Evaluation Settings는 Table 4에 보고된 모든 benchmark의 구성 세부 사항과 testing protocol을 명시한다.

E.1 일반 평가 프로토콜

별도로 명시하지 않는 한, Kimi-K2.5 실험은 256k-token 컨텍스트 길이의 표준화된 구성을 사용한다.

  • E.1 일반 평가 프로토콜: 별도로 명시하지 않는 한, Kimi-K2.5 실험은 일반적으로 256k-token 컨텍스트 길이를 사용한다.이는 일반 평가 프로토콜에서 지정한 컨텍스트 길이 설정이다.

E.2 Baselines

Baselines는 각자의 고성능 reasoning 구성으로 평가했으며, DeepSeek-V3.2와 Qwen3-VL-235B-A22B에는 modality별 설정을 적용했다. GPT-5.2 vision 점수는 보수적일 수 있고, 불안정한 API 접근으로 일부 고비용 benchmark를 수행하지 못했다.

  • Baselines에는 고성능 reasoning 설정을 사용했다: Claude Opus 4.5에는 extended thinking, GPT-5.2에는 maximum reasoning effort (xhigh), Gemini 3 Pro에는 high thinking을 적용했다.
  • DeepSeek-V3.2는 text-only benchmark에서 thinking mode를 사용했고, Qwen3-VL-235B-A22B는 vision benchmark에서 thinking mode를 사용했다.
  • GPT-5.2-xhigh vision 평가의 약 10%는 세 번의 재시도 후에도 출력을 생성하지 못했다. 이러한 실패는 오답으로 집계했으므로 점수는 보수적인 하한이다.실패는 vision 및 multimodal benchmark 중에 발생했다.
  • GPT-5.2 API에 안정적으로 접근할 수 없었기 때문에 WideSearch를 포함한 일부 고비용 benchmark를 건너뛰었다.

E.3 텍스트 벤치마크

텍스트 벤치마크 평가는 고복잡도 태스크에 확장된 reasoning budget과 반복 sampling을 사용하며, LongBench v2는 context를 표준화하고 GPT5.2-xhigh가 요구된 출력 형식을 자주 위반하므로 GPT5.2-high를 보고한다.

  • Reasoning 벤치마크: 고복잡도 reasoning 벤치마크는 충분한 reasoning depth를 지원하기 위해 최대 completion budget 96k tokens를 사용한다.벤치마크에는 HLE-Full, AIME 2025, HMMT 2025, GPQA-Diamond, IMO-AnswerBench가 포함된다.
  • Reasoning 벤치마크: AIME 2025와 HMMT 2025 결과는 64회 실행에 대해 평균을 내며, GPQA-Diamond는 stochastic-path variance를 줄이기 위해 8회 평균을 사용한다.이러한 aggregation 설정은 각각 Avg@64와 Avg@8로 보고된다.
  • LongBench v2: LongBench v2는 [9]의 truncation strategy를 사용해 context를 약 128k tokens로 표준화하고, format compliance를 위해 GPT5.2-high를 보고한다.GPT5.2-xhigh는 요구된 multiple-choice 형식 대신 free-form question–answer 응답을 자주 생성한다.

E.4 이미지 및 비디오 벤치마크 · E.5 코딩 및 소프트웨어 엔지니어링

이미지/비디오 벤치마크는 표준화된 샘플링과 프로토콜별 평가 설정을 사용하며, 코딩 벤치마크는 제약된 에이전트 프레임워크, 비사고 구성, 안정성을 위한 반복 실행에 의존한다.

  • E.4 이미지 및 비디오 벤치마크: 이미지 및 비디오 평가는 Avg@3을 사용해 세 번의 독립 실행 결과를 평균낸다.
  • E.4 이미지 및 비디오 벤치마크: ZeroBench 다단계 추론은 단계별 생성에 제약을 두며, 단계당 최대 토큰 예산은 24k다.
  • E.4 이미지 및 비디오 벤치마크: MMMU-Pro는 입력 순서를 보존하고 텍스트 시퀀스 앞에 이미지를 추가하는 공식 프로토콜을 따른다.
  • E.4 이미지 및 비디오 벤치마크: 비디오 평가는 짧은 비디오에 대해 해상도 896의 균일 프레임 128개를, 긴 비디오에 대해 해상도 448의 균일 프레임 2048개를 샘플링한다.짧은 비디오 벤치마크에는 VideoMMMU, MMVU, MotionBench가 포함되며, 긴 비디오 벤치마크에는 Video-MME, LongVideoBench, LVBench가 포함된다.
  • E.5 코딩 및 소프트웨어 엔지니어링: Terminal Bench 2.0은 기본 Terminus-2 프레임워크와 JSON parser를 사용하며, thinking mode의 컨텍스트 처리가 대화 상태와 호환되지 않기 때문에 non-thinking mode에서 평가한다.
  • E.5 코딩 및 소프트웨어 엔지니어링: SWE-Bench 변형은 6개의 repository-editing tools와 맞춤형 프롬프트를 사용하는 내부 프레임워크를 적용하며, 최고 성능은 non-thinking mode에서 달성된다.변형은 Verified, Multilingual, Pro다.
  • E.5 코딩 및 소프트웨어 엔지니어링: 코딩 결과는 환경 초기화와 비결정적 테스트 순서 전반의 안정성을 높이기 위해 Avg@5를 사용해 다섯 번의 독립 실행 결과를 평균낸다.CyberGym은 난이도 1에서 보고하며, PaperBench는 CodeDev 설정을 사용한다.

E.6 에이전틱 평가 … F 시각화

평가 절에서는 에이전틱, computer-use, Agent Swarm 태스크를 위한 tool-enabled 프로토콜을 정의하며, context management, sampling, step budget, one-shot 설정을 다룬다. 시각화 절에서는 정성적 예시를 통해 long-form video analysis와 tool-augmented visual reasoning을 보여준다.

  • E.6 에이전틱 평가: 에이전틱 평가에서는 HLE 및 여러 search benchmark에서 Kimi-K2.5에 web search, code interpretation, web browsing tools를 제공한다.평가된 benchmark에는 BrowseComp, WideSearch, DeepSearchQA, FinSearchComp T2&T3, Seal-0이 포함된다.
  • E.6 에이전틱 평가: Context management는 일반적으로 비활성화하며, 지나치게 긴 태스크는 실패로 집계한다. HLE는 이전 reasoning을 유지하면서 오래된 tool result를 잘라내는 반면, BrowseComp는 full-history 및 discard-all 설정도 테스트한다.Seal-0과 WideSearch에서는 서로 독립적인 네 번의 실행 결과를 평균내며, 달리 명시되지 않은 다른 에이전틱 benchmark에서는 단일 실행을 사용한다.
  • E.7 Computer-Use 평가: Computer-use 실험은 max_steps_per_episode = 100인 one-shot protocol을 사용하며, OSWorld-Verified에서는 temperature = 0, WebArena에서는 temperature = 0.1을 사용한다.에이전트 context에는 최근 세 개의 history image, 전체 thought history, task instruction이 포함된다. WebArena는 수정된 evaluation script와 judge로서 GPT-4o를 사용한다.
  • E.8 Agent Swarm 구성: Agent Swarm은 create_subagent 및 assign_task tools를 추가하여, 전문화된 agent를 정의하고 병렬 실행을 위해 동시에 dispatch할 수 있게 한다.구성은 가능한 경우 여러 agent를 동시에 실행하도록 명시적으로 권장한다.
  • E.8 Agent Swarm 구성: Agent Swarm은 benchmark별 step budget을 적용한다. BrowseComp에서는 orchestrator에 15 steps, 각 sub-agent에 100 steps를 부여하며, WideSearch에서는 양쪽 모두에 100 steps를 부여하고, In-house Bench에서는 orchestrator에 100 steps, 각 sub-agent에 50 steps를 부여한다.이 제한은 전체 tool invocation과 environment interaction에 적용된다.
  • E.9 GDPVal: GDPVal-AA 결과는 Artificial Analysis를 인용하며 2026년 일월 28일 기준으로 보고된 공식 리더보드 지표를 사용한다.제공된 문단은 지표의 출처와 기준일을 밝히지만, 표의 점수는 제공하지 않는다.
  • F 시각화: 정성적 시각화에서는 Agent Swarm이 32개 video에 걸친 24시간의 Black Myth: Wukong gameplay를 분석하고, Kimi K2.5가 tool-augmented method로 visual reasoning task를 해결하는 모습을 보여준다.Video analysis에서는 frame extraction, temporal event analysis, key-moment identification을 위해 parallel agent를 사용한다. Visual reasoning 예시에는 maze solving, pie-chart analysis, spot-the-difference detection이 포함된다.
Loading 2602.02276v2…