Actor-Critic Learning for Extended Mean Field Control with Deterministic Policies
Explorar
Noticias de IA
22318 elementos — filtrados, clasificados y sin duplicados
Think When It Matters: Conditional VLM Reasoning for Social Navigation with RL Policies
MMA-Former: Multi-Window Mixture-of-Head Attention Transformer for Adaptive PNI Predictio…
Compile, Then Page: Executable SOP Programs and a Capability-Gated Runtime for Procedural…
AutoVSR: Automatic Visual-to-Symbolic Reasoning for Symbolic Expression Generation from C…
EquiFusion: Kinematics-Agnostic Human Motion Prediction via Equivariant Latent Diffusion
The Singularity Space: A Generative Diffusion Framework for Signal Representation
Calibrated e-CUSUM Decoding for Quantized Reasoning Models: Why Token Log-Probability Is …
Efficient Test-Time Optimization for Multi-Agent Proof Autoformalization
The Nuts and Bolts of Natural Language to SQL Translation: A Systematic Analysis of Model…
GrandCode: Achieving Grandmaster Level in Competitive Programming via Agentic Reinforceme…
Valid $\ne$ Necessary: Diagnosing Latent Inefficiency in Chain-of-Thought
How Much Does Correctness Cost? Budgeted Placement of Strong Correctors in a Weak Multi-A…
Replicating Belief, Not Bits: Epistemic State Replication for Agentic Systems
The Path to Self-Evolving Clinical Systems: Scaling Medical Agents from Assistance to Aut…
PREF-Gate: Provenance-Constrained Relational Evidence Fusion with Validation-Gated Select…
A Theory of Least Autonomy in AI
Open, Reliable, and Collective: A Community-Driven Framework for Tool-Using AI Agents
What We Talk About When We Talk About LLM Planning: Evidence for Two Distinct Planning Ab…
The Hidden Footprint: Making Storage a First-Class Metric for LLM Agent Evaluation
NextFund: A Unified Performance Tracking Platform for Agentic Portfolio Management
A Formal Hierarchical Architecture for Agentic Orchestration with Stack-Based Execution a…
NVAITC AI Scientist: A Governed End-to-End Research System -- A Hypertension GWAS Case St…
Are LLMs Ready for Scientific Discovery? A Capability-Oriented Benchmark for AI Scientists
AdvNav: Behavior-Guided Black-Box Adversarial Attacks on Vision-Language Navigation
QwenPaw-Data: Bridging Facts, Methodology, and Execution for Autonomous Enterprise Data A…
Context by Distinct Information: An Auditable Dirichlet-Process Working Memory for Long, …
Annotation-Free Furniture Codes: What They Encode, and How Far They Transfer
ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples
Learning from Local Walks on Dynamic Graphs with Bandit Feedback