When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation
Explorar
Noticias de IA
21272 elementos — filtrados, clasificados y sin duplicados
Large language models for partial differential equation workflows
Policy Fragmentation or Institutional Alignment? Institutional Governance of AI in Univer…
Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Fre…
HyperAgent: Planning and Acting over Tool-Schema Hypergraphs for Tool-Use LLM Agents
UniGD: A Unified Generative-Discriminative Framework for Industrial Retrieval
Diversity is Not Ambiguity: Toward Accurate and Efficient Ambiguity Detection for Open-Do…
Learning Clinical-Trial Strategy: Offline Policy Training for Decision Agents
AI World Cup 2026: Benchmarking Large Language Models for End-to-End Football Tournament …
Towards Improving Sequential Decision-Making in LLM Agents via Experience Memory
Dr. AGENTONOMICS: A Didactic Experiment of AGENTONOMICS
Enactive Artificial Intelligence: A Decision-Centric Architecture for Complex Systems
Hybrid LLM-Augmented Reinforcement Learning Agents for Complex Sequential Decision Tasks
When Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Rea…
One Knob to Rule Them All: A Unified Optimal Transport View of Cold-Start Active Learning
WCM: World-Cognition Model for Generalizable Human-Robot Interaction
IR2Solve: Structured Intermediate Representations for Cost-Efficient Optimization Autofor…
Instruction Stacking Collapse: A Benchmark and the Capability-Dependent Value of Prompt C…
Neurosymbolic Reasoning with Incremental Knowledge for Sample Efficient Hierarchical Rein…
UrbanAgent: A Tool-Augmented Agent for Cross-System Urban Tasks
ZK-SR117: A Chunked Zero-Knowledge Attestation Design for Aggregated Fair-Lending Metrics…
LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models
BAP-SQL: Budget-Aware Observation Planning for Agentic Text-to-SQL
SynEnergy: Anomaly Semantic-Guided Diffusion for Synthetic Energy Data Generation
LiveEvalBench: Toward Open-World Evaluation for Web Generation
Output-Aware Rotation for INT2 KV-Cache Quantization
Knowing the Form, Not the Function: Automatically Auditing Answer--Authority Decoupling i…
Agentic Reinforcement Learning with Self-Distilled Reward Shaping
Fail-Fast, Restart-Smart: Early Failure Prediction and Restart for SWE Agentic Tasks
When Oracle Conditioning Misleads Deployment: Conditioning-Availability Bias in Echocardi…