CoT-Core: Accelerating LLM Evaluation via CoT-Aware Coreset Selection
Explorar
Noticias de IA
30239 elementos — filtrados, clasificados y sin duplicados
402Pilot: An x402 Decision Layer for Autonomous Agent Micropayments
High-Stakes Decisions with Language Models: Insights from Emergency Triage
Characterizing Readability Issue Patterns and the Role of Prompt Design in LLM-Generated …
Defending Membership Inference Attacks via Privacy-aware Sparsity Tuning
LakeMLB: Data Lake Machine Learning Benchmark
Rethinking LLM-Judged Helpfulness as a Pedagogy Signal: A Pre-Registered Audit Across Tut…
RAG-TESTER: Automated End-to-End Testing of Retrieval-Augmented Large Language Models
Computational Approaches to Understanding Large Language Model Impact on Writing and Info…
TCPO: Turn-Level Credit Policy Optimization
From We to Me: Theory Informed Narrative Shift with Abductive Reasoning
A Contractualist Argumentation Framework for Moral Decision-Making
Where Reasoning Diverges: Localized Multi-Agent Debate
From AI Technical Debt to Agentic Technical Debt: A Systematic Mapping of Root Causes and…
Role-Decoupled Attention Residuals: Separating Matching and Content Retrieval Across Depth
Oscillatory Hierarchical Reservoirs for Human-like Rhythm Perception and Anticipation
Cross-Benchmark Generalization in Long-Horizon Agents
Evolutionary Curriculum Learning Improves Biological Sequence Modeling
Toward Fine-Grained Forgetting:Attribute Unlearning for Multimodal Large Language Models
Interpretable Recognition of Cognitive Distortions in Natural Language Texts
Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets
Escaping Confidence Trap: Evolutionary Decoding for Mathematical Reasoning in Diffusion L…
Auditing Discovery Claims: A Two-Sided Criterion for Agentic Science, with the Negative S…
SkillTrace: Traversing a Query-Skill Graph for Composable LLM Agents
RAP: KV-Cache Compression via RoPE-Aligned Pruning
Large language models improve physician accuracy but lead to false reliance
Passing Coarse Marginal Checks Can Be Cheap: Persona Mixtures and Imprecise Treatment-Res…
When LLM Essays Outscore Student Essays: What a Korean Writing Rubric Rewards and Where R…
Request-Level Energy Attribution for Batched LLM Serving
Auditing Semantic Gains in Sequential Recommendation: A Lightweight Recovery Test