Policy Gradient for Continuous-Time Robust Markov Decision Processes
Explorar
Noticias de IA
21862 elementos — filtrados, clasificados y sin duplicados
Measuring What Matters: Synthetic Benchmarks for Concept Bottleneck Models
Neural Galerkin Normalizing Flows for Bayesian Inference of Diffusions with Inaccessible …
More than 6 out of 10 people turn to AI for psychological support
AI Outperforms Law Professors in Stanford Law Study
NewtPhys: Do Foundation Models Understand Newtonian Physics?
Skill-RM: Unifying Heterogeneous Evaluation Criteria via Agent Skill
AlignAtt4LLM: Fast AlignAtt for Decoder-Only LLMs at IWSLT 2026 Simultaneous Speech Trans…
Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning
Efficient ASR Training with Conversations that Never Happened
VLESA: Vision-Language Embodied Safety Agent for Human Activity Monitoring
FlashbackCL: Mitigating Temporal Forgetting in Federated Learning
Correcting Neural Operator Spectral Bias via Diffusion Posterior Sampling with Sparse Obs…
FFR: Forward-Forward Learning for Regression
Agent libOS: A Library-OS-Inspired Runtime for Long-Running, Capability-Controlled LLM Ag…
Finding Needles in the Haystack: Transductive Active Labeling in Ecology
Leveraging BART to Assess CS1 C++ Programming Assignments using Rubric-based Criteria
Consistency Training Can Entrench Misalignment
Merit or networks? What decides where research is published
Conformal Language Modeling via Posterior Sampling
Re-Ranking Through an Attribution Lens for Citation Quality in Legal QA
Investigating Adversarial Robustness of Multi-modal Large Language Models
Towards Non-Monotonic Entailment in Propositional Defeasible Standpoint Logic
Graph Regularized Non-negative Reduced Biquaternion Matrix Factorization for Color Image …
Bridging Auxiliary Constraints to Resolve Instruction Following in Large Reasoning Models
Testing LLM Arithmetic Reasoning Generalization with Automatic Numeric-Remapping Attacks
World Models Meet Language Models: On the Complementarity of Concrete and Abstract Reason…
When Attention Collapses: Stage-Aware Visual Token Pruning from Structure to Semantics
How Many Trees in a Random Forest? A Revisited Approach with Plateau Search and Optuna In…
Post-Hoc Robustness for Model-Based Reinforcement Learning