Explorar

Noticias de IA

27413 elementos — filtrados, clasificados y sin duplicados

arXiv cs.AI Research & Papers
Exploiting Verification-Generation Gap: Test-Time Reinforcement Learning with Confidence-…
arXiv cs.AI Research & Papers
Agentic Chain-of-Thought Steering for Efficient and Controllable LLM Reasoning
arXiv cs.AI Research & Papers
QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards
arXiv cs.AI Research & Papers
FlashbackCL: Mitigating Temporal Forgetting in Federated Learning
arXiv cs.AI Research & Papers
Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning
arXiv cs.AI Research & Papers
Post-Hoc Robustness for Model-Based Reinforcement Learning
arXiv cs.AI Research & Papers
The Shape of Addition: Geometric Structures of Arithmetic in Large Language Models
arXiv cs.AI Research & Papers
From 'What' to 'How' and 'Why': Sharing LLM-Generated Retrospective Summaries of Older Ad…
arXiv cs.AI Research & Papers
Beyond Encoder Accumulation: Measuring Encoder Roles in Multi-Encoder VLMs
arXiv cs.AI Research & Papers
Synthesize and Reward -- Reinforcement Learning for Multi-Step Tool Use in Live Environme…
arXiv cs.AI Research & Papers
Agent libOS: A Library-OS-Inspired Runtime for Long-Running, Capability-Controlled LLM Ag…
arXiv cs.AI Research & Papers
Clustered Self-Assessment: A Simple yet Effective Method for Uncertainty Quantification i…
arXiv cs.AI Research & Papers
Taiji: Pareto Optimal Policy Optimization with Semantics-IDs Trade-off for Industrial LLM…
arXiv cs.AI Research & Papers
Self-Refining Agentic Reinforcement Learning for Vision-Conditioned UAV Navigation
arXiv cs.AI Research & Papers
Distribution-Calibrated Inference Time Compute for Thinking LLM-as-a-Judge
arXiv cs.AI Research & Papers
Consistency Training Can Entrench Misalignment
arXiv cs.AI Research & Papers
Conditional Latent Diffusion Model with Fourier-based Motion Modelling for Virtual Popula…
arXiv cs.AI Research & Papers
Decomposing how prompting steers behavior
arXiv cs.AI Research & Papers
E2LLM: Towards Efficient LLM Serving in Heterogeneous Edge/Fog Environments
arXiv cs.AI Research & Papers
Signed Spiking Neuron Enabled by an Orthogonal-Easy-Axis Magnetic Tunnel Junction
arXiv cs.AI Research & Papers
Trading Human Curation for Synthetic Augmentation in RLVR
arXiv cs.AI Research & Papers
PURGE: Projected Unlearning via Retain-Guided Erasure
arXiv cs.AI Research & Papers
Efficient ASR Training with Conversations that Never Happened
arXiv cs.AI Research & Papers
Too Much of a Good Thing: When sim2real Efforts Impede Policy Learning (And What to Do Ab…
arXiv cs.AI Research & Papers
Unveiling the Structure of Do-Calculus Reasoning via Derivation Graphs
arXiv cs.AI Research & Papers
Geometry-Aware Tabular Diffusion
arXiv cs.AI Research & Papers
When to Re-Plan: Subgoal Persistence in Hierarchical Latent Reasoning
arXiv cs.AI Research & Papers
LAP: An Agent-to-Instrument Protocol for Autonomous Science
arXiv cs.AI Research & Papers
OpenAgenet/OAN: Open Infrastructure for Trusted Agent Interconnection
arXiv cs.AI Research & Papers
The Shadow Price of Reasoning: Economic Perspective on Optimal Budget Allocation for LLMs