Exploiting Verification-Generation Gap: Test-Time Reinforcement Learning with Confidence-…
Explorar
Noticias de IA
27413 elementos — filtrados, clasificados y sin duplicados
Agentic Chain-of-Thought Steering for Efficient and Controllable LLM Reasoning
QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards
FlashbackCL: Mitigating Temporal Forgetting in Federated Learning
Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning
Post-Hoc Robustness for Model-Based Reinforcement Learning
The Shape of Addition: Geometric Structures of Arithmetic in Large Language Models
From 'What' to 'How' and 'Why': Sharing LLM-Generated Retrospective Summaries of Older Ad…
Beyond Encoder Accumulation: Measuring Encoder Roles in Multi-Encoder VLMs
Synthesize and Reward -- Reinforcement Learning for Multi-Step Tool Use in Live Environme…
Agent libOS: A Library-OS-Inspired Runtime for Long-Running, Capability-Controlled LLM Ag…
Clustered Self-Assessment: A Simple yet Effective Method for Uncertainty Quantification i…
Taiji: Pareto Optimal Policy Optimization with Semantics-IDs Trade-off for Industrial LLM…
Self-Refining Agentic Reinforcement Learning for Vision-Conditioned UAV Navigation
Distribution-Calibrated Inference Time Compute for Thinking LLM-as-a-Judge
Consistency Training Can Entrench Misalignment
Conditional Latent Diffusion Model with Fourier-based Motion Modelling for Virtual Popula…
Decomposing how prompting steers behavior
E2LLM: Towards Efficient LLM Serving in Heterogeneous Edge/Fog Environments
Signed Spiking Neuron Enabled by an Orthogonal-Easy-Axis Magnetic Tunnel Junction
Trading Human Curation for Synthetic Augmentation in RLVR
PURGE: Projected Unlearning via Retain-Guided Erasure
Efficient ASR Training with Conversations that Never Happened
Too Much of a Good Thing: When sim2real Efforts Impede Policy Learning (And What to Do Ab…
Unveiling the Structure of Do-Calculus Reasoning via Derivation Graphs
Geometry-Aware Tabular Diffusion
When to Re-Plan: Subgoal Persistence in Hierarchical Latent Reasoning
LAP: An Agent-to-Instrument Protocol for Autonomous Science
OpenAgenet/OAN: Open Infrastructure for Trusted Agent Interconnection
The Shadow Price of Reasoning: Economic Perspective on Optimal Budget Allocation for LLMs