Clustered Self-Assessment: A Simple yet Effective Method for Uncertainty Quantification i…
Explorar
Noticias de IA
21863 elementos — filtrados, clasificados y sin duplicados
Agent libOS: A Library-OS-Inspired Runtime for Long-Running, Capability-Controlled LLM Ag…
Synthesize and Reward -- Reinforcement Learning for Multi-Step Tool Use in Live Environme…
Beyond Encoder Accumulation: Measuring Encoder Roles in Multi-Encoder VLMs
From 'What' to 'How' and 'Why': Sharing LLM-Generated Retrospective Summaries of Older Ad…
Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning
FlashbackCL: Mitigating Temporal Forgetting in Federated Learning
QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards
Agentic Chain-of-Thought Steering for Efficient and Controllable LLM Reasoning
Humanoid-GPT: Scaling Data and Structure for Zero-Shot Motion Tracking
Formalizing the Binding Problem
AlphaEval: A Comprehensive and Efficient Evaluation Framework for Formula Alpha Mining
Assistax: A Multi-Agent Hardware-Accelerated Reinforcement Learning Benchmark for Assisti…
ProtocolBench: Which LLM MultiAgent Protocol to Choose?
RGMem: Renormalization Group-inspired Memory Evolution for Language Agents
MIND: Multi-rationale INtegrated Discriminative Reasoning Framework for Multi-modal Large…
Strongly Polynomial Time Complexity of Policy Iteration for $L_\infty$ Robust MDPs
A Scoping Review of the Ethical Perspectives on Anthropomorphising Large Language Model-B…
Towards a Science of AI Agent Reliability
Who Deserves the Reward? SHARP: Shapley Credit-based Optimization for Multi-Agent System
Towards Robust Sequential Decomposition for Complex Image Editing
Evaluating Relational Reasoning in LLMs with REL
ProEval: Proactive Failure Discovery and Efficient Performance Estimation for Generative …
$R^2$-dLLM: Accelerating Diffusion Large Language Models via Spatio-Temporal Redundancy R…
Efficient Hyperparameter Optimization for LLM Reinforcement Learning
Efficient Temporal Datalog Materialisation for Composite Event Recognition
From Context to Skills: Can Language Models Learn from Context Skillfully?
Crystal: Characterizing Relative Impact of Scholarly Publications
Causal Neural Probabilistic Circuits
PnP-Corrector: A Universal Correction Framework for Coupled Spatiotemporal Forecasting