Computation and Language

Papers filed under cs.CL on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

3,601 to 3,660 of 11,332

  1. VisualPRM: An Effective Process Reward Model for Multimodal Reasoning

    Weiyun Wang, Zhangwei Gao, Lianjie Chen +12

    cs.CVcs.CLarXiv:2503.10291v12025
  2. MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers

    Zhenting Wang, Qi Chang, Hemani Patel +8

    cs.CLarXiv:2508.20453v12025
  3. Coreference Resolution as Query-based Span Prediction

    Wei Wu, Fei Wang, Arianna Yuan +2

    cs.CLarXiv:1911.01746v42019
  4. ViewSpatial-Bench: Evaluating Multi-perspective Spatial Localization in Vision-Language Models

    Dingming Li, Hongxing Li, Zixuan Wang +9

    cs.CVcs.AIcs.CLarXiv:2505.21500v22025
  5. SkillWeaver: Web Agents can Self-Improve by Discovering and Honing Skills

    Boyuan Zheng, Michael Y. Fatemi, Xiaolong Jin +8

    cs.AIcs.CLcs.CVarXiv:2504.07079v12025
  6. Unifying Vision, Text, and Layout for Universal Document Processing

    Zineng Tang, Ziyi Yang, Guoxin Wang +6

    cs.CVcs.AIcs.CLarXiv:2212.02623v32022
  7. SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning

    Yuqian Fu, Tinghong Chen, Jiajun Chai +7

    cs.CLcs.AIcs.LGarXiv:2506.19767v12025
  8. The Semantic Scholar Open Data Platform

    Rodney Kinney, Chloe Anastasiades, Russell Authur +45

    cs.DLcs.CLarXiv:2301.10140v22023
  9. COLD-Attack: Jailbreaking LLMs with Stealthiness and Controllability

    Xingang Guo, Fangxu Yu, Huan Zhang +2

    cs.LGcs.AIcs.CLarXiv:2402.08679v22024
  10. Compile, Don't Memorize: A Context Compilation Architecture (CCA) for In-Context Learning

    Jinhu Qi, Minda Hu, Wentao Zhang +4

    cs.CLarXiv:2609.00759v12026
  11. PersonaMem-v2: Towards Personalized Intelligence via Learning Implicit User Personas and Agentic Memory

    Bowen Jiang, Yuan Yuan, Maohao Shen +13

    cs.CLarXiv:2512.06688v12025
  12. Backdoor Attacks on Pre-trained Models by Layerwise Weight Poisoning

    Linyang Li, Demin Song, Xiaonan Li +3

    cs.CRcs.CLarXiv:2108.13888v12021
  13. Dynamic Cheatsheet: Test-Time Learning with Adaptive Memory

    Mirac Suzgun, Mert Yuksekgonul, Federico Bianchi +2

    cs.LGcs.CLarXiv:2504.07952v12025
  14. olmOCR: Unlocking Trillions of Tokens in PDFs with Vision Language Models

    Jake Poznanski, Aman Rangapur, Jon Borchardt +7

    cs.CLarXiv:2502.18443v32025
  15. Citing Less Critically: LLMs Reshape the Rhetoric and Reach of Scientific Citation

    Yixuan Liu, Lin Chen, Zhuoqi Liu +2

    cs.DLcs.CLcs.CYarXiv:2609.01432v12026
  16. OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling

    Zengzhi Wang, Fan Zhou, Xuefeng Li +1

    cs.CLcs.AIcs.LGarXiv:2506.20512v12025
  17. Aligned but Flattened: Analyzing the Trade-off between Cultural Alignment and Diversity in LLMs

    Jingshen Zhang, Shaoyang Xu, Wenxuan Zhang

    cs.SIcs.CLarXiv:2609.00565v12026
  18. Expected Attention: KV Cache Compression by Estimating Attention from Future Queries Distribution

    Alessio Devoto, Maximilian Jeblick, Simon Jégou

    cs.AIcs.CLarXiv:2510.00636v12025
  19. Polish ModernBERT: The Long and Short of Polish Language Understanding

    Michał Perełkiewicz, Sławomir Dadas, Rafał Poświata +1

    cs.CLarXiv:2609.01379v12026
  20. SWE-rebench: An Automated Pipeline for Task Collection and Decontaminated Evaluation of Software Engineering Agents

    Ibragim Badertdinov, Alexander Golubev, Maksim Nekrashevich +6

    cs.SEcs.CLarXiv:2505.20411v22025
  21. VITA: Towards Open-Source Interactive Omni Multimodal LLM

    Chaoyou Fu, Haojia Lin, Zuwei Long +16

    cs.CVcs.AIcs.CLarXiv:2408.05211v32024
  22. Overview of the TREC 2021 deep learning track

    Nick Craswell, Bhaskar Mitra, Emine Yilmaz +2

    cs.IRcs.AIcs.CLarXiv:2507.08191v12025
  23. LLM Social Simulations Are a Promising Research Method

    Jacy Reese Anthis, Ryan Liu, Sean M. Richardson +5

    cs.HCcs.AIcs.CLarXiv:2504.02234v22025
  24. MedReason: Eliciting Factual Medical Reasoning Steps in LLMs via Knowledge Graphs

    Juncheng Wu, Wenlong Deng, Xingxuan Li +12

    cs.CLcs.AIarXiv:2504.00993v22025
  25. PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models

    Mingyang Song, Zhaochen Su, Xiaoye Qu +2

    cs.CLcs.AIcs.LGarXiv:2501.03124v52025
  26. AgenTracer: Who Is Inducing Failure in the LLM Agentic Systems?

    Guibin Zhang, Junhao Wang, Junjie Chen +3

    cs.CLcs.MAarXiv:2509.03312v22025
  27. UniIR: Training and Benchmarking Universal Multimodal Information Retrievers

    Cong Wei, Yang Chen, Haonan Chen +5

    cs.CVcs.AIcs.CLarXiv:2311.17136v12023
  28. Latent Visual Reasoning

    Bangzheng Li, Ximeng Sun, Jiang Liu +7

    cs.CVcs.CLarXiv:2509.24251v22025
  29. Jointly Predicting Predicates and Arguments in Neural Semantic Role Labeling

    Luheng He, Kenton Lee, Omer Levy +1

    cs.CLarXiv:1805.04787v22018
  30. Compositional Generalization and Natural Language Variation: Can a Semantic Parsing Approach Handle Both?

    Peter Shaw, Ming-Wei Chang, Panupong Pasupat +1

    cs.CLarXiv:2010.12725v22020
  31. Medical Hallucinations in Foundation Models and Their Impact on Healthcare

    Yubin Kim, Hyewon Jeong, Shan Chen +24

    cs.CLcs.AIcs.CYarXiv:2503.05777v22025
  32. Unifying Conformal Language Tasks with In-Context Ensembles

    Xiao Shi Huang, Chen-Yuan Lin, Bruce Kuwahara +2

    cs.CLcs.LGstat.MLarXiv:2609.03005v12026
  33. The Geometry of Ignorance: LLMs Know When to Temper Bayesian Priors

    Toni J. B. Liu, Jiajun Bao, Yizhou Liu +4

    cs.LGcs.AIcs.CLarXiv:2609.02959v12026
  34. Recursive Language Models

    Alex L. Zhang, Tim Kraska, Omar Khattab

    cs.AIcs.CLarXiv:2512.24601v32025
  35. SoftCoT: Soft Chain-of-Thought for Efficient Reasoning with LLMs

    Yige Xu, Xu Guo, Zhiwei Zeng +1

    cs.CLarXiv:2502.12134v22025
  36. Incremental Pooled LLM Evaluation for Cost-Effective Retrieval Model Selection

    Max Nelson, Hanoz Bhathena, Aviral Joshi +1

    cs.IRcs.CLarXiv:2609.02745v12026
  37. LLMs Accelerate Annotation for Medical Information Extraction

    Akshay Goel, Almog Gueta, Omry Gilon +10

    cs.CLcs.AIcs.LGarXiv:2312.02296v12023
  38. Perception-Aware Policy Optimization for Multimodal Reasoning

    Zhenhailong Wang, Xuehang Guo, Sofia Stoica +8

    cs.CLarXiv:2507.06448v52025
  39. Exploring Versatile Generative Language Model Via Parameter-Efficient Transfer Learning

    Zhaojiang Lin, Andrea Madotto, Pascale Fung

    cs.CLarXiv:2004.03829v22020
  40. ToRL: Scaling Tool-Integrated RL

    Xuefeng Li, Haoyang Zou, Pengfei Liu

    cs.CLarXiv:2503.23383v12025
  41. Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis

    Zhen Ye, Xinfa Zhu, Chi-Min Chan +17

    eess.AScs.AIcs.CLarXiv:2502.04128v22025
  42. Soft Thinking: Unlocking the Reasoning Potential of LLMs in Continuous Concept Space

    Zhen Zhang, Xuehai He, Weixiang Yan +5

    cs.CLcs.AIarXiv:2505.15778v12025
  43. On Releasing Annotator-Level Labels and Information in Datasets

    Vinodkumar Prabhakaran, Aida Mostafazadeh Davani, Mark Díaz

    cs.CLcs.CYarXiv:2110.05699v12021
  44. HalluLens: LLM Hallucination Benchmark

    Yejin Bang, Ziwei Ji, Alan Schelten +5

    cs.CLcs.AIarXiv:2504.17550v12025
  45. Test-Time Training Done Right

    Tianyuan Zhang, Sai Bi, Yicong Hong +6

    cs.LGcs.CLcs.CVarXiv:2505.23884v12025
  46. Hallucinated but Factual! Inspecting the Factuality of Hallucinations in Abstractive Summarization

    Meng Cao, Yue Dong, Jackie Chi Kit Cheung

    cs.CLarXiv:2109.09784v22021
  47. Scalable Direction-Following TTS via Voice Impression-Guided Pseudo Triplet Construction

    Kenichi Fujita, Yusuke Ijima

    cs.SDcs.CLcs.LGarXiv:2609.02623v12026
  48. Breadth Beats Depth: Improving GCG-Based Jailbreak Optimization with Breadth-Oriented Suffix Search

    Shiliang Xiao, Jingsong Wei, Yuzhi Liang +3

    cs.CLcs.LGarXiv:2609.02172v12026
  49. Reasoning with Sampling: Your Base Model is Smarter Than You Think

    Aayush Karan, Yilun Du

    cs.LGcs.AIcs.CLarXiv:2510.14901v12025
  50. Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents

    Hao Wang, Guozhi Wang, Han Xiao +8

    cs.LGcs.AIcs.CLarXiv:2604.10674v12026
  51. More Agents Is All You Need

    Junyou Li, Qin Zhang, Yangbin Yu +2

    cs.CLcs.AIcs.LGarXiv:2402.05120v22024
  52. From Once Upon a Time to Happily Ever After: Tracking Emotions in Novels and Fairy Tales

    Saif Mohammad

    cs.CLarXiv:1309.5909v12013
  53. Untangling the Mechanisms of Misleading Context in Medical Question Answering

    Robin Linzmayer, Noémie Elhadad

    cs.CLcs.AIcs.LGarXiv:2609.02754v12026
  54. Audio-Reasoner: Improving Reasoning Capability in Large Audio Language Models

    Zhifei Xie, Mingbao Lin, Zihang Liu +3

    cs.SDcs.AIcs.CLarXiv:2503.02318v22025
  55. A Comprehensive Survey on Word Representation Models: From Classical to State-Of-The-Art Word Representation Language Models

    Usman Naseem, Imran Razzak, Shah Khalid Khan +1

    cs.CLarXiv:2010.15036v12020
  56. ResearchRubrics: A Benchmark of Prompts and Rubrics For Evaluating Deep Research Agents

    Manasi Sharma, Chen Bo Calvin Zhang, Chaithanya Bandi +13

    cs.AIcs.CLcs.LGarXiv:2511.07685v12025
  57. Seed-Prover: Deep and Broad Reasoning for Automated Theorem Proving

    Luoxin Chen, Jinming Gu, Liankai Huang +33

    cs.AIcs.CLarXiv:2507.23726v22025
  58. Fine-Tuning Large Neural Language Models for Biomedical Natural Language Processing

    Robert Tinn, Hao Cheng, Yu Gu +5

    cs.CLcs.LGarXiv:2112.07869v12021
  59. KodCode: A Diverse, Challenging, and Verifiable Synthetic Dataset for Coding

    Zhangchen Xu, Yang Liu, Yueqin Yin +2

    cs.LGcs.AIcs.CLarXiv:2503.02951v22025
  60. ChartQAPro: A More Diverse and Challenging Benchmark for Chart Question Answering

    Ahmed Masry, Mohammed Saidul Islam, Mahir Ahmed +11

    cs.CLarXiv:2504.05506v22025