Computation and Language
Papers filed under cs.CL on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
3,001 to 3,060 of 11,196
Diffusion Language Models Know the Answer Before Decoding
Pengxiang Li, Yefan Zhou, Dilxat Muhtar +5
cs.CLcs.AIarXiv:2508.19982v52025Retrieval, Scoring, and Decoding Shape Performance and Stability in LLM-based Conversational Recommendation
Ante Kapetanovic, Tomislav Duricic, Andro Mercep +1
cs.CLcs.AIarXiv:2609.00086v12026A Survey of AIOps in the Era of Large Language Models
Lingzhe Zhang, Tong Jia, Mengxi Jia +7
cs.SEcs.CLarXiv:2507.12472v12025AgentProv: Auditing Agentic LLM API Providers via Tool-use Policy Probes
Xun Wang, Bihe Zhao, Michael Backes +2
cs.CRcs.CLcs.LGarXiv:2609.00052v12026Textless Speech-to-Speech Translation on Real Data
Ann Lee, Hongyu Gong, Paul-Ambroise Duquenne +8
cs.CLcs.AIcs.LGarXiv:2112.08352v22021Acting Less is Reasoning More! Teaching Model to Act Efficiently
Hongru Wang, Cheng Qian, Wanjun Zhong +7
cs.AIcs.CLarXiv:2504.14870v22025LLM4SR: A Survey on Large Language Models for Scientific Research
Ziming Luo, Zonglin Yang, Zexin Xu +2
cs.CLcs.DLarXiv:2501.04306v12025Mind2Web 2: Evaluating Agentic Search with Agent-as-a-Judge
Boyu Gou, Zanming Huang, Yuting Ning +23
cs.AIcs.CLarXiv:2506.21506v22025Sources of Truth: A Multi-Platform, Multilingual Audit of Citations in AI Mental Health Information Queries
Phuong Anh Nguyen, Jill Noorily, Matthew Flathers +7
cs.CYcs.CLcs.IRarXiv:2609.00319v12026Reinforcing General Reasoning without Verifiers
Xiangxin Zhou, Zichen Liu, Anya Sims +6
cs.LGcs.CLarXiv:2505.21493v12025Router-R1: Teaching LLMs Multi-Round Routing and Aggregation via Reinforcement Learning
Haozhen Zhang, Tao Feng, Jiaxuan You
cs.CLcs.AIcs.LGarXiv:2506.09033v32025Sentence Centrality Revisited for Unsupervised Summarization
Hao Zheng, Mirella Lapata
cs.CLarXiv:1906.03508v12019Rethinking embedding coupling in pre-trained language models
Hyung Won Chung, Thibault Févry, Henry Tsai +2
cs.CLcs.LGarXiv:2010.12821v12020Efficient Reasoning Models: A Survey
Sicheng Feng, Gongfan Fang, Xinyin Ma +1
cs.CLcs.AIarXiv:2504.10903v22025SealQA: Raising the Bar for Reasoning in Search-Augmented Language Models
Thinh Pham, Nguyen Nguyen, Pratibha Zunjare +3
cs.CLcs.AIcs.LGarXiv:2506.01062v42025Talk Isn't Always Cheap: Understanding Failure Modes in Multi-Agent Debate
Andrea Wynn, Harsh Satija, Gillian Hadfield
cs.CLcs.AIcs.MAarXiv:2509.05396v22025Emotional Labor Strategy Preferences in LLM Personas
Mohammad Saim, Tianyu Jiang
cs.CLarXiv:2609.00310v12026Synthetic Data Generation with Large Language Models for Text Classification: Potential and Limitations
Zhuoyan Li, Hangxiao Zhu, Zhuoran Lu +1
cs.CLcs.AIarXiv:2310.07849v22023Hidden Backdoors in Human-Centric Language Models
Shaofeng Li, Hui Liu, Tian Dong +4
cs.CLcs.CRarXiv:2105.00164v32021Nemotron-H: A Family of Accurate and Efficient Hybrid Mamba-Transformer Models
NVIDIA, :, Aaron Blakeman +198
cs.CLcs.AIcs.LGarXiv:2504.03624v42025LLM-as-a-Demographic: Whom Sociodemographic Prompting Helps, and Whom It Hurts
Daniela Occhipinti, Andrea Piergentili, Marco Guerini
cs.CLarXiv:2609.00222v12026Reinforcement Learning for Reasoning in Small LLMs: What Works and What Doesn't
Quy-Anh Dang, Chris Ngo
cs.LGcs.CLarXiv:2503.16219v22025NoveltyBench: Evaluating Language Models for Humanlike Diversity
Yiming Zhang, Harshita Diddee, Susan Holm +5
cs.CLarXiv:2504.05228v42025ART: Automatic multi-step reasoning and tool-use for large language models
Bhargavi Paranjape, Scott Lundberg, Sameer Singh +3
cs.CLarXiv:2303.09014v12023Learning from the Worst: Dynamically Generated Datasets to Improve Online Hate Detection
Bertie Vidgen, Tristan Thrush, Zeerak Waseem +1
cs.CLcs.LGarXiv:2012.15761v22020Cultural Moment Benchmark: Evaluating Video Cultural Reasoning and Grounding in Southeast Asia
Burak Satar, Zhixin Ma, Cheng Yu-Tong +3
cs.CVcs.AIcs.CLarXiv:2608.23065v12026Simpler but More Accurate Semantic Dependency Parsing
Timothy Dozat, Christopher D. Manning
cs.CLarXiv:1807.01396v12018Increasing Diversity While Maintaining Accuracy: Text Data Generation with Large Language Models and Human Interventions
John Joon Young Chung, Ece Kamar, Saleema Amershi
cs.CLarXiv:2306.04140v12023AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress
Zhiheng Xi, Chenyang Liao, Guanyu Li +12
cs.CLcs.IRcs.LGarXiv:2511.08325v12025Fine-tuned Language Models are Continual Learners
Thomas Scialom, Tuhin Chakrabarty, Smaranda Muresan
cs.CLarXiv:2205.12393v42022CUDA-Harness: Harnessing Agentic CUDA Kernel Generation and Optimization from Natural Language
Qi Fan, An Zou, Yehan Ma
cs.CLcs.AIcs.MAarXiv:2609.00058v12026MT-R1-Zero: Advancing LLM-based Machine Translation via R1-Zero-like Reinforcement Learning
Zhaopeng Feng, Shaosheng Cao, Jiahan Ren +7
cs.CLcs.AIcs.LGarXiv:2504.10160v12025Beyond Textual Chain-of-Thought: A Survey on Action-Grounded Reasoning in Autonomous Driving
Zhengxu Tang, Xiaozhou Zhang, Guofeng Cui +10
cs.CVcs.CLcs.ROarXiv:2609.01659v12026Atom of Thoughts for Markov LLM Test-Time Scaling
Fengwei Teng, Quan Shi, Zhaoyang Yu +4
cs.CLcs.AIcs.LGarXiv:2502.12018v42025CoLT-Drive: Counterfactual Long-Tail Benchmarking and Knowledge-Preserving Adaptation for Driving Affordance Prediction
Zhengxu Tang, Guofeng Cui, Ziyu Gong +8
cs.CVcs.AIcs.CLarXiv:2609.00242v12026Quantization Hurts Reasoning? An Empirical Study on Quantized Reasoning Models
Ruikang Liu, Yuxuan Sun, Manyi Zhang +5
cs.CLcs.AIarXiv:2504.04823v22025How Do AI Agents Spend Your Money? Analyzing and Predicting Token Consumption in Agentic Coding Tasks
Longju Bai, Zhemin Huang, Xingyao Wang +5
cs.CLcs.AIcs.CYarXiv:2604.22750v22026DeepType: Multilingual Entity Linking by Neural Type System Evolution
Jonathan Raiman, Olivier Raiman
cs.CLarXiv:1802.01021v12018Argument Mining as a Text-to-Text Generation Task
Masayuki Kawarada, Tsutomu Hirao, Wataru Uchida +1
cs.CLarXiv:2603.23949v12026TeMP: Temporal Message Passing for Temporal Knowledge Graph Completion
Jiapeng Wu, Meng Cao, Jackie Chi Kit Cheung +1
cs.LGcs.AIcs.CLarXiv:2010.03526v12020Revisiting the Test-Time Scaling of o1-like Models: Do they Truly Possess Test-Time Scaling Capabilities?
Zhiyuan Zeng, Qinyuan Cheng, Zhangyue Yin +2
cs.LGcs.AIcs.CLarXiv:2502.12215v22025Grounded, Compute-Efficient LLM Policy Agents for Energy-Poverty Equity in Physically-Constrained Peer-to-Peer Energy Markets
Kunal Jadhav, Siddhesh More
cs.CLarXiv:2609.01918v12026SimpleVQA: Multimodal Factuality Evaluation for Multimodal Large Language Models
Xianfu Cheng, Wei Zhang, Shiwei Zhang +16
cs.CLarXiv:2502.13059v12025NaturalReasoning: Reasoning in the Wild with 2.8M Challenging Questions
Weizhe Yuan, Jane Yu, Song Jiang +8
cs.CLarXiv:2502.13124v42025Commonsense for Generative Multi-Hop Question Answering Tasks
Lisa Bauer, Yicheng Wang, Mohit Bansal
cs.CLcs.AIarXiv:1809.06309v32018GAPS: Dimension-Level Gates for Conditional Activation Steering
Moghis Fereidouni, Muhammad Umair Haider, Hassan Sajjad +1
cs.CLarXiv:2609.01878v12026Fact-Checking the Output of Large Language Models via Token-Level Uncertainty Quantification
Ekaterina Fadeeva, Aleksandr Rubashevskii, Artem Shelmanov +9
cs.CLcs.AIcs.LGarXiv:2403.04696v22024ViDoRAG: Visual Document Retrieval-Augmented Generation via Dynamic Iterative Reasoning Agents
Qiuchen Wang, Ruixue Ding, Zehui Chen +4
cs.CVcs.AIcs.CLarXiv:2502.18017v22025EvoX: Meta-Evolution for Automated Discovery
Shu Liu, Shubham Agarwal, Monishwaran Maheswaran +14
cs.LGcs.CLcs.NEarXiv:2602.23413v22026Between Underthinking and Overthinking: An Empirical Study of Reasoning Length and correctness in LLMs
Jinyan Su, Jennifer Healey, Preslav Nakov +1
cs.CLcs.AIarXiv:2505.00127v12025Human-like Summarization Evaluation with ChatGPT
Mingqi Gao, Jie Ruan, Renliang Sun +3
cs.CLarXiv:2304.02554v12023WebGen-Bench: Evaluating LLMs on Generating Interactive and Functional Websites from Scratch
Zimu Lu, Yunqiao Yang, Houxing Ren +7
cs.CLarXiv:2505.03733v22025"Do Not Mention This to the User": Detecting and Understanding Malicious Agent Skills in the Wild
Yi Liu, Zhihao Chen, Yanjun Zhang +4
cs.CRcs.AIcs.CLarXiv:2602.06547v42026SAMGPT: Text-free Graph Foundation Model for Multi-domain Pre-training and Cross-domain Adaptation
Xingtong Yu, Zechuan Gong, Chang Zhou +2
cs.CLcs.AIarXiv:2502.05424v22025A Review of Keyphrase Extraction
Eirini Papagiannopoulou, Grigorios Tsoumakas
cs.CLcs.IRarXiv:1905.05044v22019BRIGHTER: BRIdging the Gap in Human-Annotated Textual Emotion Recognition Datasets for 28 Languages
Shamsuddeen Hassan Muhammad, Nedjma Ousidhoum, Idris Abdulmumin +45
cs.CLarXiv:2502.11926v42025PersianAnonymizer: Evaluating LLM-Labeled Training for Efficient NER-based Anonymization in Persian
Mohammad Hossein Shalchian, Mostafa Amiri, Amir Mahdi Sadeghzadeh
cs.CLarXiv:2609.00958v12026MentaLLaMA: Interpretable Mental Health Analysis on Social Media with Large Language Models
Kailai Yang, Tianlin Zhang, Ziyan Kuang +3
cs.CLarXiv:2309.13567v32023Energy Considerations of Large Language Model Inference and Efficiency Optimizations
Jared Fernandez, Clara Na, Vashisth Tiwari +3
cs.CLcs.LGarXiv:2504.17674v12025r/Fakeddit: A New Multimodal Benchmark Dataset for Fine-grained Fake News Detection
Kai Nakamura, Sharon Levy, William Yang Wang
cs.CLcs.CYcs.IRarXiv:1911.03854v22019