Computation and Language
Papers filed under cs.CL on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
3,601 to 3,660 of 11,332
VisualPRM: An Effective Process Reward Model for Multimodal Reasoning
Weiyun Wang, Zhangwei Gao, Lianjie Chen +12
cs.CVcs.CLarXiv:2503.10291v12025MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers
Zhenting Wang, Qi Chang, Hemani Patel +8
cs.CLarXiv:2508.20453v12025Coreference Resolution as Query-based Span Prediction
Wei Wu, Fei Wang, Arianna Yuan +2
cs.CLarXiv:1911.01746v42019ViewSpatial-Bench: Evaluating Multi-perspective Spatial Localization in Vision-Language Models
Dingming Li, Hongxing Li, Zixuan Wang +9
cs.CVcs.AIcs.CLarXiv:2505.21500v22025SkillWeaver: Web Agents can Self-Improve by Discovering and Honing Skills
Boyuan Zheng, Michael Y. Fatemi, Xiaolong Jin +8
cs.AIcs.CLcs.CVarXiv:2504.07079v12025Unifying Vision, Text, and Layout for Universal Document Processing
Zineng Tang, Ziyi Yang, Guoxin Wang +6
cs.CVcs.AIcs.CLarXiv:2212.02623v32022SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning
Yuqian Fu, Tinghong Chen, Jiajun Chai +7
cs.CLcs.AIcs.LGarXiv:2506.19767v12025The Semantic Scholar Open Data Platform
Rodney Kinney, Chloe Anastasiades, Russell Authur +45
cs.DLcs.CLarXiv:2301.10140v22023COLD-Attack: Jailbreaking LLMs with Stealthiness and Controllability
Xingang Guo, Fangxu Yu, Huan Zhang +2
cs.LGcs.AIcs.CLarXiv:2402.08679v22024Compile, Don't Memorize: A Context Compilation Architecture (CCA) for In-Context Learning
Jinhu Qi, Minda Hu, Wentao Zhang +4
cs.CLarXiv:2609.00759v12026PersonaMem-v2: Towards Personalized Intelligence via Learning Implicit User Personas and Agentic Memory
Bowen Jiang, Yuan Yuan, Maohao Shen +13
cs.CLarXiv:2512.06688v12025Backdoor Attacks on Pre-trained Models by Layerwise Weight Poisoning
Linyang Li, Demin Song, Xiaonan Li +3
cs.CRcs.CLarXiv:2108.13888v12021Dynamic Cheatsheet: Test-Time Learning with Adaptive Memory
Mirac Suzgun, Mert Yuksekgonul, Federico Bianchi +2
cs.LGcs.CLarXiv:2504.07952v12025olmOCR: Unlocking Trillions of Tokens in PDFs with Vision Language Models
Jake Poznanski, Aman Rangapur, Jon Borchardt +7
cs.CLarXiv:2502.18443v32025Citing Less Critically: LLMs Reshape the Rhetoric and Reach of Scientific Citation
Yixuan Liu, Lin Chen, Zhuoqi Liu +2
cs.DLcs.CLcs.CYarXiv:2609.01432v12026OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling
Zengzhi Wang, Fan Zhou, Xuefeng Li +1
cs.CLcs.AIcs.LGarXiv:2506.20512v12025Aligned but Flattened: Analyzing the Trade-off between Cultural Alignment and Diversity in LLMs
Jingshen Zhang, Shaoyang Xu, Wenxuan Zhang
cs.SIcs.CLarXiv:2609.00565v12026Expected Attention: KV Cache Compression by Estimating Attention from Future Queries Distribution
Alessio Devoto, Maximilian Jeblick, Simon Jégou
cs.AIcs.CLarXiv:2510.00636v12025Polish ModernBERT: The Long and Short of Polish Language Understanding
Michał Perełkiewicz, Sławomir Dadas, Rafał Poświata +1
cs.CLarXiv:2609.01379v12026SWE-rebench: An Automated Pipeline for Task Collection and Decontaminated Evaluation of Software Engineering Agents
Ibragim Badertdinov, Alexander Golubev, Maksim Nekrashevich +6
cs.SEcs.CLarXiv:2505.20411v22025VITA: Towards Open-Source Interactive Omni Multimodal LLM
Chaoyou Fu, Haojia Lin, Zuwei Long +16
cs.CVcs.AIcs.CLarXiv:2408.05211v32024Overview of the TREC 2021 deep learning track
Nick Craswell, Bhaskar Mitra, Emine Yilmaz +2
cs.IRcs.AIcs.CLarXiv:2507.08191v12025LLM Social Simulations Are a Promising Research Method
Jacy Reese Anthis, Ryan Liu, Sean M. Richardson +5
cs.HCcs.AIcs.CLarXiv:2504.02234v22025MedReason: Eliciting Factual Medical Reasoning Steps in LLMs via Knowledge Graphs
Juncheng Wu, Wenlong Deng, Xingxuan Li +12
cs.CLcs.AIarXiv:2504.00993v22025PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models
Mingyang Song, Zhaochen Su, Xiaoye Qu +2
cs.CLcs.AIcs.LGarXiv:2501.03124v52025AgenTracer: Who Is Inducing Failure in the LLM Agentic Systems?
Guibin Zhang, Junhao Wang, Junjie Chen +3
cs.CLcs.MAarXiv:2509.03312v22025UniIR: Training and Benchmarking Universal Multimodal Information Retrievers
Cong Wei, Yang Chen, Haonan Chen +5
cs.CVcs.AIcs.CLarXiv:2311.17136v12023Latent Visual Reasoning
Bangzheng Li, Ximeng Sun, Jiang Liu +7
cs.CVcs.CLarXiv:2509.24251v22025Jointly Predicting Predicates and Arguments in Neural Semantic Role Labeling
Luheng He, Kenton Lee, Omer Levy +1
cs.CLarXiv:1805.04787v22018Compositional Generalization and Natural Language Variation: Can a Semantic Parsing Approach Handle Both?
Peter Shaw, Ming-Wei Chang, Panupong Pasupat +1
cs.CLarXiv:2010.12725v22020Medical Hallucinations in Foundation Models and Their Impact on Healthcare
Yubin Kim, Hyewon Jeong, Shan Chen +24
cs.CLcs.AIcs.CYarXiv:2503.05777v22025Unifying Conformal Language Tasks with In-Context Ensembles
Xiao Shi Huang, Chen-Yuan Lin, Bruce Kuwahara +2
cs.CLcs.LGstat.MLarXiv:2609.03005v12026The Geometry of Ignorance: LLMs Know When to Temper Bayesian Priors
Toni J. B. Liu, Jiajun Bao, Yizhou Liu +4
cs.LGcs.AIcs.CLarXiv:2609.02959v12026Recursive Language Models
Alex L. Zhang, Tim Kraska, Omar Khattab
cs.AIcs.CLarXiv:2512.24601v32025SoftCoT: Soft Chain-of-Thought for Efficient Reasoning with LLMs
Yige Xu, Xu Guo, Zhiwei Zeng +1
cs.CLarXiv:2502.12134v22025Incremental Pooled LLM Evaluation for Cost-Effective Retrieval Model Selection
Max Nelson, Hanoz Bhathena, Aviral Joshi +1
cs.IRcs.CLarXiv:2609.02745v12026LLMs Accelerate Annotation for Medical Information Extraction
Akshay Goel, Almog Gueta, Omry Gilon +10
cs.CLcs.AIcs.LGarXiv:2312.02296v12023Perception-Aware Policy Optimization for Multimodal Reasoning
Zhenhailong Wang, Xuehang Guo, Sofia Stoica +8
cs.CLarXiv:2507.06448v52025Exploring Versatile Generative Language Model Via Parameter-Efficient Transfer Learning
Zhaojiang Lin, Andrea Madotto, Pascale Fung
cs.CLarXiv:2004.03829v22020ToRL: Scaling Tool-Integrated RL
Xuefeng Li, Haoyang Zou, Pengfei Liu
cs.CLarXiv:2503.23383v12025Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis
Zhen Ye, Xinfa Zhu, Chi-Min Chan +17
eess.AScs.AIcs.CLarXiv:2502.04128v22025Soft Thinking: Unlocking the Reasoning Potential of LLMs in Continuous Concept Space
Zhen Zhang, Xuehai He, Weixiang Yan +5
cs.CLcs.AIarXiv:2505.15778v12025On Releasing Annotator-Level Labels and Information in Datasets
Vinodkumar Prabhakaran, Aida Mostafazadeh Davani, Mark Díaz
cs.CLcs.CYarXiv:2110.05699v12021HalluLens: LLM Hallucination Benchmark
Yejin Bang, Ziwei Ji, Alan Schelten +5
cs.CLcs.AIarXiv:2504.17550v12025Test-Time Training Done Right
Tianyuan Zhang, Sai Bi, Yicong Hong +6
cs.LGcs.CLcs.CVarXiv:2505.23884v12025Hallucinated but Factual! Inspecting the Factuality of Hallucinations in Abstractive Summarization
Meng Cao, Yue Dong, Jackie Chi Kit Cheung
cs.CLarXiv:2109.09784v22021Scalable Direction-Following TTS via Voice Impression-Guided Pseudo Triplet Construction
Kenichi Fujita, Yusuke Ijima
cs.SDcs.CLcs.LGarXiv:2609.02623v12026Breadth Beats Depth: Improving GCG-Based Jailbreak Optimization with Breadth-Oriented Suffix Search
Shiliang Xiao, Jingsong Wei, Yuzhi Liang +3
cs.CLcs.LGarXiv:2609.02172v12026Reasoning with Sampling: Your Base Model is Smarter Than You Think
Aayush Karan, Yilun Du
cs.LGcs.AIcs.CLarXiv:2510.14901v12025Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents
Hao Wang, Guozhi Wang, Han Xiao +8
cs.LGcs.AIcs.CLarXiv:2604.10674v12026More Agents Is All You Need
Junyou Li, Qin Zhang, Yangbin Yu +2
cs.CLcs.AIcs.LGarXiv:2402.05120v22024From Once Upon a Time to Happily Ever After: Tracking Emotions in Novels and Fairy Tales
Saif Mohammad
cs.CLarXiv:1309.5909v12013Untangling the Mechanisms of Misleading Context in Medical Question Answering
Robin Linzmayer, Noémie Elhadad
cs.CLcs.AIcs.LGarXiv:2609.02754v12026Audio-Reasoner: Improving Reasoning Capability in Large Audio Language Models
Zhifei Xie, Mingbao Lin, Zihang Liu +3
cs.SDcs.AIcs.CLarXiv:2503.02318v22025A Comprehensive Survey on Word Representation Models: From Classical to State-Of-The-Art Word Representation Language Models
Usman Naseem, Imran Razzak, Shah Khalid Khan +1
cs.CLarXiv:2010.15036v12020ResearchRubrics: A Benchmark of Prompts and Rubrics For Evaluating Deep Research Agents
Manasi Sharma, Chen Bo Calvin Zhang, Chaithanya Bandi +13
cs.AIcs.CLcs.LGarXiv:2511.07685v12025Seed-Prover: Deep and Broad Reasoning for Automated Theorem Proving
Luoxin Chen, Jinming Gu, Liankai Huang +33
cs.AIcs.CLarXiv:2507.23726v22025Fine-Tuning Large Neural Language Models for Biomedical Natural Language Processing
Robert Tinn, Hao Cheng, Yu Gu +5
cs.CLcs.LGarXiv:2112.07869v12021KodCode: A Diverse, Challenging, and Verifiable Synthetic Dataset for Coding
Zhangchen Xu, Yang Liu, Yueqin Yin +2
cs.LGcs.AIcs.CLarXiv:2503.02951v22025ChartQAPro: A More Diverse and Challenging Benchmark for Chart Question Answering
Ahmed Masry, Mohammed Saidul Islam, Mahir Ahmed +11
cs.CLarXiv:2504.05506v22025