Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics
Explorar
Noticias de IA
21863 elementos — filtrados, clasificados y sin duplicados
SMAC-Talk: A Natural Language Extension of the StarCraft Multi-Agent Challenge for Large …
Dynamic Content Moderation in Livestreams: Combining Supervised Classification with MLLM-…
Can Generalist Agents Automate Data Curation?
The Saturation Trap and the Subjectivity of Intervention Timing: Why Affect-Based Trigger…
Exploring Cross-Scenario Generality of Agentic Memory Systems: Diagnostics and a Strong B…
MesaNet: Sequence Modeling by Locally Optimal Test-Time Training
Online Skill Learning for Web Agents via State-Grounded Dynamic Retrieval
Trivium: Temporal Regret as a First-Class Objective for Causal-Memory Controllers
Bilevel Autoresearch: Meta-Autoresearching Itself
OckBench: Measuring the Efficiency of LLM Reasoning
Beyond Prompt-Based Planning: MCP-Native Graph Planning-based Biomedical Agent System
Simulate, Reason, Decide: Scientific Reasoning with LLMs for Simulation-Driven Decision M…
MapAgent: An Industrial-Grade Agentic Framework for City-scale Lane-level Map Generation
Interfaze: The Future of AI is built on Task-Specific Small Models
Neetyabhas: A Framework for Uncertainty-Aware Public Policy Optimization in Rational Agen…
SCI-PRM: A Tool Aware Process Reward Model for Scientific Reasoning Verification
Learning Admissible Heuristics via Cost Partitioning
Consensus is Strategically Insufficient: Reasoning-Trace Disagreement as a Knowledge-Repr…
A Normative Intermediate Representation for ASP-Based Compliance Reasoning
Invariant Gradient Alignment for Robust Reasoning Distillation
From Prompt to Process: a Process Taxonomy and Comparative Assessment of Frameworks Suppo…
OA-CutMix: Correcting the Label Bias of CutMix
AdaKoop: Efficient Modeling of Nonlinear Dynamics from Nonstationary Data Streams with Ko…
SUSD: Structured Unsupervised Skill Discovery through State Factorization
MENTOR: A Metacognition-Driven Self-Evolution Framework for Uncovering and Mitigating Imp…
Reinforcement Learning from Rich Feedback with Distributional DAgger
Arithmetic Pedagogy for Language Models
100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Abi…
Temporal Order Matters for Agentic Memory: Segment Trees for Long-Horizon Agents