Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems
Explorar
Noticias de IA
29372 elementos — filtrados, clasificados y sin duplicados
Skill or Skip? Learning Selective Skill Invocation in Agentic Tasks via Dual-Granularity …
On the Limits of Token Reduction for Efficient Unified Vision Language Training
TECCI: Tricky Edits of Collected and Curated Images
ChronosAD: Leveraging Time Series Foundation Models for Accurate Anomaly Detection
Consistent and Distinctive: LLM Benchmark Efficiency via Maximum Independent Set Prompt S…
Neural Network Compression by Approximate Differential Equivalence
Balancing Knowledge Distillation for Imbalance Learning with Bilevel Optimization
Crazyflow: An Accurate, GPU-Accelerated, Differentiable Drone Simulator in JAX
RADAR: Redundancy-Aware Diffusion for Multi-Agent Communication Structure Generation
Linguistics-Aware Non-Distortionary LLM Watermarking
MemPro: Agentic Memory Systems as Evolvable Programs
Trustworthy AI Suffers from Invariance Conflicts and Causality is The Solution
Process Reward Agents for Steering Knowledge-Intensive Reasoning
What's Missing in Screen-to-Action? Towards a UI-in-the-Loop Paradigm for Multimodal GUI …
AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents
PATRA: Pattern-Aware Alignment and Balanced Reasoning for Time Series Question Answering
Structure Enables Effective Self-Localization of Errors in LLMs
ReasonBENCH: Benchmarking the (In)Stability of LLM Reasoning
Multimodal Function Vectors for Visual Relations
Beyond the Mouth: Upper-Face Affective Cues in Audiovisual Sentence Recognition under Aco…
InPhyRe Discovers: Large Multimodal Models Struggle in Inductive Physical Reasoning
Stop Wandering, Find the Keys: LLMs Discriminate Key States for Efficient Multi-Agent Exp…
Why Not Hyperparameter-Friendly Optimisation? A Monotonic Adaptive Norm Rescaling Approac…
ODTQA-FoRe: An Open-Domain Tabular Question Answering Dataset for Future Data Forecasting…
Repurposing Adversarial Perturbations for Continual Learning: From Defense to Active Alig…
CityTrajBench: A Unified Benchmark for City-Scale Vehicle Trajectory Generation
GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval
Towards Resolving Optimization Conflicts Between Image- and Text-Based Person Re-Identifi…
Beyond Independent Manipulation: Individual Fairness-aware Strategic Classification with …