When Does Muon Help Agentic Reinforcement Learning?
Explorar
Noticias de IA
27413 elementos — filtrados, clasificados y sin duplicados
Evaluating Open-Weight LLMs for Generating Structured Threat Information for Autonomous V…
A Neuro-Symbolic Approach for Probabilistic Reasoning on Graph Data
IMBench: A Benchmark for Intuitive Robotic Manipulation
A Systematic Study of Large Language Models for Task and Motion Planning With PDDLStream
RL-Struct: A Lightweight Reinforcement Learning Framework for Reliable Structured Output …
RAD: Retrieval High-quality Demonstrations to Enhance Decision-making
Orbis 2: A Hierarchical World Model for Driving
Human-Aligned Procedural Level Generation Reinforcement Learning via Text-Level-Sketch Sh…
Mechanistic Interpretability of Cognitive Complexity in LLMs via Linear Probing using Blo…
UCOB: Learning to Utilize and Evolve Agentic Skills via Credit-Aware On-Policy Bidirectio…
When Not to Automate: A Formal Protocol for Human Preservation in AI-Optimized Organizati…
Design-Based Supervised Learning with Noisy Human Labels
Code-MUE: Measuring Code LLMs' Uncertainty through Execution-based Semantic Interaction G…
The AI Fiction Paradox
SciVisAgentBench: A Benchmark for Evaluating Scientific Data Analysis and Visualization A…
Robustness of Reinforcement Learning-Based Congestion Management in Low-Voltage Grids
Candidate Attended Dialogue State Tracking Using BERT
Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Age…
FAIR_XAI: Improving Multimodal Foundation Model Fairness via Explainability for Wellbeing…
ACPO: Agent-Chained Policy Optimization for Multi-Agent Reinforcement Learning
Do Coding Agents Need Executable World Models, Simplification, and Verification to Solve …
From Black Box to Executable Logic: Explainable Reinforcement Learning through Prolog Exp…
SeerGuard: A Safety Framework for Mobile GUI Agents via World Model Prediction
Long-Context Fine-Tuning with Limited VRAM
MirrorCode: AI can rebuild entire programs from behavior alone
Why do CNNs excel at feature extraction? A mathematical explanation
Are Heterogeneous Graph Neural Networks Truly Effective for Node Classification? A Causal…
CTC: The Composite Task Challenge for Cooperative Multi-Agent Reinforcement Learning
MaxSAT-Based Feedback for Guiding Vision-Language Models in Sudoku