Success Conditioning as Policy Improvement: The Optimization Problem Solved by Imitating …
Explorar
Noticias de IA
29346 elementos — filtrados, clasificados y sin duplicados
Adaptive Minds: Empowering Agents with LoRA-as-Tools
Constrained Adaptive Rejection Sampling
Failed Reasoning Traces Tell You What Is Fixable (But Not by Reading Them)
Towards Efficient and Evidence-grounded Mobility Prediction with LLM-Driven Agent
Audio Interaction Model
MENTOR: A Metacognition-Driven Self-Evolution Framework for Uncovering and Mitigating Imp…
M$^3$Eval: Multi-Modal Memory Evaluation through Cognitively-Grounded Video Tasks
DeliChess: A Multi-party Dialogue Dataset for Deliberation in Chess Puzzle Solving
Reinforcement Learning from Rich Feedback with Distributional DAgger
Geometry-Aware Distillation for Prompt Tuning Biomedical Vision-Language Models
'Your AI Text is not Mine': Redefining and Evaluating AI-generated Text Detection under R…
Learning Empirically Admissible Neural Heuristics for Combinatorial Search
Scenario Generation for Risk-Aware Reinforcement Learning with Probably Approximately Saf…
Activation Steering of Video Generation Models via Reduced-Order Linear Optimal Control
TIDE: Proactive Multi-Problem Discovery via Template-Guided Iteration
Learning Long Range Spatio-Temporal Representations over Continuous Time Dynamic Graphs w…
Arithmetic Pedagogy for Language Models
Temporal Order Matters for Agentic Memory: Segment Trees for Long-Horizon Agents
QuBLAST: A Framework for Quantizing Large Language Models with Block-Level Compression Ap…
Multi-SPIN: Multi-Access Speculative Inference for Cooperative Token Generation at the Ed…
Dynamic Infilling Anchors for Format-Constrained Generation in Diffusion Large Language M…
GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling
Treat Traffic Like Trees: A Semantic-Preserving Hierarchical Graph-Based Expert Framework…
ChessMimic: Per-Rating Transformer Models for Human Move, Clock, and Outcome Prediction i…
Evaluating Reasoning Fidelity in Visual Text Generation
An Ensembled Latent Factor Model via Differential Evolution and Gradient Descent Optimiza…
CyberGym-E2E: Scalable Real-World Benchmark for AI Agents' End-to-End Cybersecurity Capab…
What If Prompt Injection Never Left? Exploring Cross-Session Stored Prompt Injection in A…
DSIRM: Learning Query-Bridged Discrete Semantic Identifiers for E-commerce Relevance Mode…