Computation and Language

Papers filed under cs.CL on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

3,001 to 3,060 of 11,196

  1. Diffusion Language Models Know the Answer Before Decoding

    Pengxiang Li, Yefan Zhou, Dilxat Muhtar +5

    cs.CLcs.AIarXiv:2508.19982v52025
  2. Retrieval, Scoring, and Decoding Shape Performance and Stability in LLM-based Conversational Recommendation

    Ante Kapetanovic, Tomislav Duricic, Andro Mercep +1

    cs.CLcs.AIarXiv:2609.00086v12026
  3. A Survey of AIOps in the Era of Large Language Models

    Lingzhe Zhang, Tong Jia, Mengxi Jia +7

    cs.SEcs.CLarXiv:2507.12472v12025
  4. AgentProv: Auditing Agentic LLM API Providers via Tool-use Policy Probes

    Xun Wang, Bihe Zhao, Michael Backes +2

    cs.CRcs.CLcs.LGarXiv:2609.00052v12026
  5. Textless Speech-to-Speech Translation on Real Data

    Ann Lee, Hongyu Gong, Paul-Ambroise Duquenne +8

    cs.CLcs.AIcs.LGarXiv:2112.08352v22021
  6. Acting Less is Reasoning More! Teaching Model to Act Efficiently

    Hongru Wang, Cheng Qian, Wanjun Zhong +7

    cs.AIcs.CLarXiv:2504.14870v22025
  7. LLM4SR: A Survey on Large Language Models for Scientific Research

    Ziming Luo, Zonglin Yang, Zexin Xu +2

    cs.CLcs.DLarXiv:2501.04306v12025
  8. Mind2Web 2: Evaluating Agentic Search with Agent-as-a-Judge

    Boyu Gou, Zanming Huang, Yuting Ning +23

    cs.AIcs.CLarXiv:2506.21506v22025
  9. Sources of Truth: A Multi-Platform, Multilingual Audit of Citations in AI Mental Health Information Queries

    Phuong Anh Nguyen, Jill Noorily, Matthew Flathers +7

    cs.CYcs.CLcs.IRarXiv:2609.00319v12026
  10. Reinforcing General Reasoning without Verifiers

    Xiangxin Zhou, Zichen Liu, Anya Sims +6

    cs.LGcs.CLarXiv:2505.21493v12025
  11. Router-R1: Teaching LLMs Multi-Round Routing and Aggregation via Reinforcement Learning

    Haozhen Zhang, Tao Feng, Jiaxuan You

    cs.CLcs.AIcs.LGarXiv:2506.09033v32025
  12. Sentence Centrality Revisited for Unsupervised Summarization

    Hao Zheng, Mirella Lapata

    cs.CLarXiv:1906.03508v12019
  13. Rethinking embedding coupling in pre-trained language models

    Hyung Won Chung, Thibault Févry, Henry Tsai +2

    cs.CLcs.LGarXiv:2010.12821v12020
  14. Efficient Reasoning Models: A Survey

    Sicheng Feng, Gongfan Fang, Xinyin Ma +1

    cs.CLcs.AIarXiv:2504.10903v22025
  15. SealQA: Raising the Bar for Reasoning in Search-Augmented Language Models

    Thinh Pham, Nguyen Nguyen, Pratibha Zunjare +3

    cs.CLcs.AIcs.LGarXiv:2506.01062v42025
  16. Talk Isn't Always Cheap: Understanding Failure Modes in Multi-Agent Debate

    Andrea Wynn, Harsh Satija, Gillian Hadfield

    cs.CLcs.AIcs.MAarXiv:2509.05396v22025
  17. Emotional Labor Strategy Preferences in LLM Personas

    Mohammad Saim, Tianyu Jiang

    cs.CLarXiv:2609.00310v12026
  18. Synthetic Data Generation with Large Language Models for Text Classification: Potential and Limitations

    Zhuoyan Li, Hangxiao Zhu, Zhuoran Lu +1

    cs.CLcs.AIarXiv:2310.07849v22023
  19. Hidden Backdoors in Human-Centric Language Models

    Shaofeng Li, Hui Liu, Tian Dong +4

    cs.CLcs.CRarXiv:2105.00164v32021
  20. Nemotron-H: A Family of Accurate and Efficient Hybrid Mamba-Transformer Models

    NVIDIA, :, Aaron Blakeman +198

    cs.CLcs.AIcs.LGarXiv:2504.03624v42025
  21. LLM-as-a-Demographic: Whom Sociodemographic Prompting Helps, and Whom It Hurts

    Daniela Occhipinti, Andrea Piergentili, Marco Guerini

    cs.CLarXiv:2609.00222v12026
  22. Reinforcement Learning for Reasoning in Small LLMs: What Works and What Doesn't

    Quy-Anh Dang, Chris Ngo

    cs.LGcs.CLarXiv:2503.16219v22025
  23. NoveltyBench: Evaluating Language Models for Humanlike Diversity

    Yiming Zhang, Harshita Diddee, Susan Holm +5

    cs.CLarXiv:2504.05228v42025
  24. ART: Automatic multi-step reasoning and tool-use for large language models

    Bhargavi Paranjape, Scott Lundberg, Sameer Singh +3

    cs.CLarXiv:2303.09014v12023
  25. Learning from the Worst: Dynamically Generated Datasets to Improve Online Hate Detection

    Bertie Vidgen, Tristan Thrush, Zeerak Waseem +1

    cs.CLcs.LGarXiv:2012.15761v22020
  26. Cultural Moment Benchmark: Evaluating Video Cultural Reasoning and Grounding in Southeast Asia

    Burak Satar, Zhixin Ma, Cheng Yu-Tong +3

    cs.CVcs.AIcs.CLarXiv:2608.23065v12026
  27. Simpler but More Accurate Semantic Dependency Parsing

    Timothy Dozat, Christopher D. Manning

    cs.CLarXiv:1807.01396v12018
  28. Increasing Diversity While Maintaining Accuracy: Text Data Generation with Large Language Models and Human Interventions

    John Joon Young Chung, Ece Kamar, Saleema Amershi

    cs.CLarXiv:2306.04140v12023
  29. AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress

    Zhiheng Xi, Chenyang Liao, Guanyu Li +12

    cs.CLcs.IRcs.LGarXiv:2511.08325v12025
  30. Fine-tuned Language Models are Continual Learners

    Thomas Scialom, Tuhin Chakrabarty, Smaranda Muresan

    cs.CLarXiv:2205.12393v42022
  31. CUDA-Harness: Harnessing Agentic CUDA Kernel Generation and Optimization from Natural Language

    Qi Fan, An Zou, Yehan Ma

    cs.CLcs.AIcs.MAarXiv:2609.00058v12026
  32. MT-R1-Zero: Advancing LLM-based Machine Translation via R1-Zero-like Reinforcement Learning

    Zhaopeng Feng, Shaosheng Cao, Jiahan Ren +7

    cs.CLcs.AIcs.LGarXiv:2504.10160v12025
  33. Beyond Textual Chain-of-Thought: A Survey on Action-Grounded Reasoning in Autonomous Driving

    Zhengxu Tang, Xiaozhou Zhang, Guofeng Cui +10

    cs.CVcs.CLcs.ROarXiv:2609.01659v12026
  34. Atom of Thoughts for Markov LLM Test-Time Scaling

    Fengwei Teng, Quan Shi, Zhaoyang Yu +4

    cs.CLcs.AIcs.LGarXiv:2502.12018v42025
  35. CoLT-Drive: Counterfactual Long-Tail Benchmarking and Knowledge-Preserving Adaptation for Driving Affordance Prediction

    Zhengxu Tang, Guofeng Cui, Ziyu Gong +8

    cs.CVcs.AIcs.CLarXiv:2609.00242v12026
  36. Quantization Hurts Reasoning? An Empirical Study on Quantized Reasoning Models

    Ruikang Liu, Yuxuan Sun, Manyi Zhang +5

    cs.CLcs.AIarXiv:2504.04823v22025
  37. How Do AI Agents Spend Your Money? Analyzing and Predicting Token Consumption in Agentic Coding Tasks

    Longju Bai, Zhemin Huang, Xingyao Wang +5

    cs.CLcs.AIcs.CYarXiv:2604.22750v22026
  38. DeepType: Multilingual Entity Linking by Neural Type System Evolution

    Jonathan Raiman, Olivier Raiman

    cs.CLarXiv:1802.01021v12018
  39. Argument Mining as a Text-to-Text Generation Task

    Masayuki Kawarada, Tsutomu Hirao, Wataru Uchida +1

    cs.CLarXiv:2603.23949v12026
  40. TeMP: Temporal Message Passing for Temporal Knowledge Graph Completion

    Jiapeng Wu, Meng Cao, Jackie Chi Kit Cheung +1

    cs.LGcs.AIcs.CLarXiv:2010.03526v12020
  41. Revisiting the Test-Time Scaling of o1-like Models: Do they Truly Possess Test-Time Scaling Capabilities?

    Zhiyuan Zeng, Qinyuan Cheng, Zhangyue Yin +2

    cs.LGcs.AIcs.CLarXiv:2502.12215v22025
  42. Grounded, Compute-Efficient LLM Policy Agents for Energy-Poverty Equity in Physically-Constrained Peer-to-Peer Energy Markets

    Kunal Jadhav, Siddhesh More

    cs.CLarXiv:2609.01918v12026
  43. SimpleVQA: Multimodal Factuality Evaluation for Multimodal Large Language Models

    Xianfu Cheng, Wei Zhang, Shiwei Zhang +16

    cs.CLarXiv:2502.13059v12025
  44. NaturalReasoning: Reasoning in the Wild with 2.8M Challenging Questions

    Weizhe Yuan, Jane Yu, Song Jiang +8

    cs.CLarXiv:2502.13124v42025
  45. Commonsense for Generative Multi-Hop Question Answering Tasks

    Lisa Bauer, Yicheng Wang, Mohit Bansal

    cs.CLcs.AIarXiv:1809.06309v32018
  46. GAPS: Dimension-Level Gates for Conditional Activation Steering

    Moghis Fereidouni, Muhammad Umair Haider, Hassan Sajjad +1

    cs.CLarXiv:2609.01878v12026
  47. Fact-Checking the Output of Large Language Models via Token-Level Uncertainty Quantification

    Ekaterina Fadeeva, Aleksandr Rubashevskii, Artem Shelmanov +9

    cs.CLcs.AIcs.LGarXiv:2403.04696v22024
  48. ViDoRAG: Visual Document Retrieval-Augmented Generation via Dynamic Iterative Reasoning Agents

    Qiuchen Wang, Ruixue Ding, Zehui Chen +4

    cs.CVcs.AIcs.CLarXiv:2502.18017v22025
  49. EvoX: Meta-Evolution for Automated Discovery

    Shu Liu, Shubham Agarwal, Monishwaran Maheswaran +14

    cs.LGcs.CLcs.NEarXiv:2602.23413v22026
  50. Between Underthinking and Overthinking: An Empirical Study of Reasoning Length and correctness in LLMs

    Jinyan Su, Jennifer Healey, Preslav Nakov +1

    cs.CLcs.AIarXiv:2505.00127v12025
  51. Human-like Summarization Evaluation with ChatGPT

    Mingqi Gao, Jie Ruan, Renliang Sun +3

    cs.CLarXiv:2304.02554v12023
  52. WebGen-Bench: Evaluating LLMs on Generating Interactive and Functional Websites from Scratch

    Zimu Lu, Yunqiao Yang, Houxing Ren +7

    cs.CLarXiv:2505.03733v22025
  53. "Do Not Mention This to the User": Detecting and Understanding Malicious Agent Skills in the Wild

    Yi Liu, Zhihao Chen, Yanjun Zhang +4

    cs.CRcs.AIcs.CLarXiv:2602.06547v42026
  54. SAMGPT: Text-free Graph Foundation Model for Multi-domain Pre-training and Cross-domain Adaptation

    Xingtong Yu, Zechuan Gong, Chang Zhou +2

    cs.CLcs.AIarXiv:2502.05424v22025
  55. A Review of Keyphrase Extraction

    Eirini Papagiannopoulou, Grigorios Tsoumakas

    cs.CLcs.IRarXiv:1905.05044v22019
  56. BRIGHTER: BRIdging the Gap in Human-Annotated Textual Emotion Recognition Datasets for 28 Languages

    Shamsuddeen Hassan Muhammad, Nedjma Ousidhoum, Idris Abdulmumin +45

    cs.CLarXiv:2502.11926v42025
  57. PersianAnonymizer: Evaluating LLM-Labeled Training for Efficient NER-based Anonymization in Persian

    Mohammad Hossein Shalchian, Mostafa Amiri, Amir Mahdi Sadeghzadeh

    cs.CLarXiv:2609.00958v12026
  58. MentaLLaMA: Interpretable Mental Health Analysis on Social Media with Large Language Models

    Kailai Yang, Tianlin Zhang, Ziyan Kuang +3

    cs.CLarXiv:2309.13567v32023
  59. Energy Considerations of Large Language Model Inference and Efficiency Optimizations

    Jared Fernandez, Clara Na, Vashisth Tiwari +3

    cs.CLcs.LGarXiv:2504.17674v12025
  60. r/Fakeddit: A New Multimodal Benchmark Dataset for Fine-grained Fake News Detection

    Kai Nakamura, Sharon Levy, William Yang Wang

    cs.CLcs.CYcs.IRarXiv:1911.03854v22019