Computation and Language

Papers filed under cs.CL on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

3,241 to 3,300 of 11,218

  1. DeepSearchQA: Bridging the Comprehensiveness Gap for Deep Research Agents

    Nikita Gupta, Riju Chatterjee, Lukas Haas +9

    cs.CLarXiv:2601.20975v12026
  2. PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding

    Selim Kuzucu, Alessio Tonioni, Vasile Lup +3

    cs.CVcs.AIcs.CLarXiv:2605.30126v12026
  3. STAR-1: Safer Alignment of Reasoning LLMs with 1K Data

    Zijun Wang, Haoqin Tu, Yuhan Wang +6

    cs.CLcs.AIarXiv:2504.01903v22025
  4. On Data Engineering for Scaling LLM Terminal Capabilities

    Renjie Pi, Grace Lam, Mohammad Shoeybi +3

    cs.CLarXiv:2602.21193v12026
  5. Context-Grounding Gains Are Mediated by Pre-existing Machinery: Auditing GRPO, SFT, and DPO

    Prakhar Gupta, Vaibhav Gupta

    cs.CLcs.AIcs.LGarXiv:2609.00925v12026
  6. Layered LLM Defenses as an Ensemble: Access Tiers, Inference Cost, and the Measured Failure Correlation Between Defense Layers

    Abrar Alotaibi, Muhammad Shahid Jabbar, Sadam Al-Azani +1

    cs.CRcs.AIcs.CLarXiv:2608.28327v12026
  7. NeuroCogMap Reveals Cognitive Organization of Large Language Models

    Zhongxiang Sun, Haolang Lu, Qiang Ma +11

    q-bio.NCcs.AIcs.CLarXiv:2607.00397v12026
    Summaries:한국어
  8. Data Determines Distributional Robustness in Contrastive Language Image Pre-training (CLIP)

    Alex Fang, Gabriel Ilharco, Mitchell Wortsman +4

    cs.CVcs.CLcs.LGarXiv:2205.01397v22022
  9. Geometric-Mean Policy Optimization

    Yuzhong Zhao, Yue Liu, Junpeng Liu +9

    cs.CLarXiv:2507.20673v32025
  10. Uncertainty Quantification and Confidence Calibration in Large Language Models: A Survey

    Xiaoou Liu, Tiejin Chen, Longchao Da +3

    cs.CLarXiv:2503.15850v22025
  11. Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering

    Gang Li, Jizhong Liu, Heinrich Dinkel +3

    cs.SDcs.AIcs.CLarXiv:2503.11197v42025
  12. Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning

    Yixuan Even Xu, Yash Savani, Fei Fang +1

    cs.LGcs.AIcs.CLarXiv:2504.13818v52025
  13. Modeling Sentiment Dependencies with Graph Convolutional Networks for Aspect-level Sentiment Classification

    Pinlong Zhaoa, Linlin Houb, Ou Wua

    cs.CLcs.LGarXiv:1906.04501v12019
  14. SWE-Fixer: Training Open-Source LLMs for Effective and Efficient GitHub Issue Resolution

    Chengxing Xie, Bowen Li, Chang Gao +4

    cs.CLarXiv:2501.05040v32025
  15. VDocRAG: Retrieval-Augmented Generation over Visually-Rich Documents

    Ryota Tanaka, Taichi Iki, Taku Hasegawa +3

    cs.CLcs.AIcs.CVarXiv:2504.09795v12025
  16. Better Summarization Evaluation with Word Embeddings for ROUGE

    Jun-Ping Ng, Viktoria Abrecht

    cs.CLcs.IRarXiv:1508.06034v12015
  17. Machine Comprehension by Text-to-Text Neural Question Generation

    Xingdi Yuan, Tong Wang, Caglar Gulcehre +5

    cs.CLarXiv:1705.02012v22017
  18. More Thinking, Less Seeing? Assessing Amplified Hallucination in Multimodal Reasoning Models

    Chengzhi Liu, Zhongxing Xu, Qingyue Wei +5

    cs.CLcs.AIcs.CVarXiv:2505.21523v32025
  19. WritingBench: A Comprehensive Benchmark for Generative Writing

    Yuning Wu, Jiahao Mei, Ming Yan +8

    cs.AIcs.CLarXiv:2503.05244v42025
  20. Lessons from the Trenches on Reproducible Evaluation of Language Models

    Stella Biderman, Hailey Schoelkopf, Lintang Sutawika +27

    cs.CLarXiv:2405.14782v32024
  21. Lingua Franca or Probing Artifact? Rethinking Latent Language in Multilingual LLMs

    Deniz Bayazit, Badr AlKhamissi, Antoine Bosselut

    cs.CLcs.AIcs.LGarXiv:2609.00155v12026
  22. mmBERT: A Modern Multilingual Encoder with Annealed Language Learning

    Marc Marone, Orion Weller, William Fleshman +3

    cs.CLcs.IRcs.LGarXiv:2509.06888v12025
  23. How Well do LLMs Compress Their Own Chain-of-Thought? A Token Complexity Approach

    Ayeong Lee, Ethan Che, Tianyi Peng

    cs.CLcs.AIarXiv:2503.01141v22025
  24. KItCAT: Knowledge Injection via Input Corruption for Auto-regressive Training

    Meghanadh Pulivarthi, Kushagra Bhushan, Vineet Kumar +5

    cs.CLcs.AIarXiv:2609.00082v12026
  25. MultiBLiMP 1.0: A Massively Multilingual Benchmark of Linguistic Minimal Pairs

    Jaap Jumelet, Leonie Weissweiler, Joakim Nivre +1

    cs.CLarXiv:2504.02768v42025
  26. Aristotle: IMO-level Automated Theorem Proving

    Tudor Achim, Alex Best, Alberto Bietti +20

    cs.AIcs.CLarXiv:2510.01346v22025
  27. dParallel: Learnable Parallel Decoding for dLLMs

    Zigeng Chen, Gongfan Fang, Xinyin Ma +2

    cs.CLarXiv:2509.26488v12025
  28. Vision Is Not Overhead: One-Pass Block Drafting for Lossless Speculative Decoding in Vision-Language Models

    Jungseob Lee, Seongtae Hong, Dongyub Jude Lee +4

    cs.AIcs.CLcs.CVarXiv:2609.00355v12026
  29. A Survey of Word Embeddings Evaluation Methods

    Amir Bakarov

    cs.CLarXiv:1801.09536v12018
  30. DiTAR: Diffusion Transformer Autoregressive Modeling for Speech Generation

    Dongya Jia, Zhuo Chen, Jiawei Chen +8

    eess.AScs.AIcs.CLarXiv:2502.03930v42025
  31. Chain-of-Agents: End-to-End Agent Foundation Models via Multi-Agent Distillation and Agentic RL

    Weizhen Li, Jianbo Lin, Zhuosong Jiang +27

    cs.AIcs.CLarXiv:2508.13167v12025
  32. SafeArena: Evaluating the Safety of Autonomous Web Agents

    Ada Defne Tur, Nicholas Meade, Xing Han Lù +6

    cs.LGcs.AIcs.CLarXiv:2503.04957v12025
  33. Token Assorted: Mixing Latent and Text Tokens for Improved Language Model Reasoning

    DiJia Su, Hanlin Zhu, Yingchen Xu +3

    cs.CLcs.AIcs.LGarXiv:2502.03275v22025
  34. AdaEvolve: Adaptive LLM Driven Zeroth-Order Optimization

    Mert Cemri, Shubham Agrawal, Akshat Gupta +9

    cs.NEcs.AIcs.CLarXiv:2602.20133v12026
  35. Vision-Language Models Do Not Understand Negation

    Kumail Alhamoud, Shaden Alshammari, Yonglong Tian +4

    cs.CVcs.CLarXiv:2501.09425v22025
  36. MMC: Advancing Multimodal Chart Understanding with Large-scale Instruction Tuning

    Fuxiao Liu, Xiaoyang Wang, Wenlin Yao +5

    cs.CLcs.AIarXiv:2311.10774v22023
  37. Investigating Cultural Alignment of Large Language Models

    Badr AlKhamissi, Muhammad ElNokrashy, Mai AlKhamissi +1

    cs.CLcs.CYarXiv:2402.13231v22024
  38. LLaMA-Omni2: LLM-based Real-time Spoken Chatbot with Autoregressive Streaming Speech Synthesis

    Qingkai Fang, Yan Zhou, Shoutao Guo +2

    cs.CLcs.AIcs.SDarXiv:2505.02625v12025
  39. Same Semantics, Different Outcome: On the Modality Robustness of Multimodal LLMs under Knowledge Conflict

    Jungyeon Lee, Yejin Yoon, Taeuk Kim

    cs.CLarXiv:2609.00550v12026
  40. Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning

    Vaishnavi Shrivastava, Ahmed Awadallah, Vidhisha Balachandran +3

    cs.CLcs.LGarXiv:2508.09726v12025
  41. AgentEvolver: Towards Efficient Self-Evolving Agent System

    Yunpeng Zhai, Shuchang Tao, Cheng Chen +10

    cs.LGcs.AIcs.CLarXiv:2511.10395v12025
  42. Neural Semantic Role Labeling with Dependency Path Embeddings

    Michael Roth, Mirella Lapata

    cs.CLarXiv:1605.07515v22016
  43. A Sober Look at Progress in Language Model Reasoning: Pitfalls and Paths to Reproducibility

    Andreas Hochlehnert, Hardik Bhatnagar, Vishaal Udandarao +3

    cs.LGcs.CLarXiv:2504.07086v22025
  44. Multi-Agent Design: Optimizing Agents with Better Prompts and Topologies

    Han Zhou, Xingchen Wan, Ruoxi Sun +5

    cs.LGcs.AIcs.CLarXiv:2502.02533v22025
  45. MMLU-ProX: A Multilingual Benchmark for Advanced Large Language Model Evaluation

    Weihao Xuan, Rui Yang, Heli Qi +29

    cs.CLarXiv:2503.10497v22025
  46. Why Is Spatial Reasoning Hard for VLMs? An Attention Mechanism Perspective on Focus Areas

    Shiqi Chen, Tongyao Zhu, Ruochen Zhou +7

    cs.CLarXiv:2503.01773v32025
  47. MLGym: A New Framework and Benchmark for Advancing AI Research Agents

    Deepak Nathani, Lovish Madaan, Nicholas Roberts +14

    cs.CLcs.AIcs.LGarXiv:2502.14499v12025
  48. Inducing Programmatic Skills for Agentic Tasks

    Zora Zhiruo Wang, Apurva Gandhi, Graham Neubig +1

    cs.CLarXiv:2504.06821v22025
  49. When Modality Gap Reduction Fails: Prediction-Level Hubness in CLIP

    Shota Sato, Hajime Kiyama, Tosho Hirasawa +1

    cs.CLcs.CVarXiv:2609.01103v12026
  50. ReCLIP: A Strong Zero-Shot Baseline for Referring Expression Comprehension

    Sanjay Subramanian, William Merrill, Trevor Darrell +3

    cs.CVcs.CLarXiv:2204.05991v22022
  51. Text Readability Assessment for Second Language Learners

    Menglin Xia, Ekaterina Kochmar, Ted Briscoe

    cs.CLarXiv:1906.07580v12019
  52. How to (Properly) Evaluate Cross-Lingual Word Embeddings: On Strong Baselines, Comparative Analyses, and Some Misconceptions

    Goran Glavas, Robert Litschko, Sebastian Ruder +1

    cs.CLarXiv:1902.00508v12019
  53. Improving Multi-Task Deep Neural Networks via Knowledge Distillation for Natural Language Understanding

    Xiaodong Liu, Pengcheng He, Weizhu Chen +1

    cs.CLarXiv:1904.09482v12019
  54. The Geometry of Refusal in Large Language Models: Concept Cones and Representational Independence

    Tom Wollschläger, Jannes Elstner, Simon Geisler +3

    cs.LGcs.AIcs.CLarXiv:2502.17420v22025
  55. Memp: Exploring Agent Procedural Memory

    Runnan Fang, Yuan Liang, Xiaobin Wang +6

    cs.CLcs.AIcs.LGarXiv:2508.06433v42025
  56. Perception-R1: Pioneering Perception Policy with Reinforcement Learning

    En Yu, Kangheng Lin, Liang Zhao +11

    cs.CVcs.CLarXiv:2504.07954v12025
  57. Multiagent Finetuning: Self Improvement with Diverse Reasoning Chains

    Vighnesh Subramaniam, Yilun Du, Joshua B. Tenenbaum +3

    cs.CLcs.AIcs.LGarXiv:2501.05707v22025
  58. Beneath the Diff: Diagnosing and Mitigating Algorithmic Mode Collapse in Code-Level Autonomous Research Loops

    Bowei He, Weixu Zhang, Yili Jin +1

    cs.CLcs.SEarXiv:2609.00077v12026
  59. NSIDDx: A Design Framework for Neuro-Symbolic, Practitioner-First Differential Diagnosis in Low-Resource Settings

    Aarav Singh

    cs.CLarXiv:2609.00256v12026
  60. Deep Video Discovery: Agentic Search with Tool Use for Long-form Video Understanding

    Xiaoyi Zhang, Zhaoyang Jia, Zongyu Guo +4

    cs.CVcs.AIcs.CLarXiv:2505.18079v42025