Calibrated Selective Fact-Checking via Evidence Chain Evaluation
Explorar
Noticias de IA
22116 elementos — filtrados, clasificados y sin duplicados
SysAdmin: Measuring Instrumental Power-Seeking in Frontier AI
Lifting Embodied World Models for Planning and Control
Why Do Vision Language Models Struggle To Recognize Human Emotions?
Robust Reasoning Benchmark
Team RAS in 11th ABAW Competition: Multimodal Ambivalence Recognition Approach
LakeQuest: A Three-Domain Benchmark for Grounded Question Answering across Data Lakes
Tunable MAGMAX: Preference-Aware Model Merging for Continual Learning
Global Automation Atlas
AlayaWorld: Interactive Long-Horizon World Modeling -- Full Technical Report
Operational Hallucination and Safety Drift in AI Agents
Deep Reinforcement Learning to Master the Asymmetric Strategy of Baghchal
Using LLMs for Explainable, Data-Driven Insight Generation from Time Series
Wisdom of LLM Crowds: Aggregation and Contamination in Language Model Ensembles
Large Language Models Explore by Latent Distilling
When Agents Disagree: The Selection Bottleneck in Multi-Agent LLM Pipelines
Fly0: Persistent Metric Anchoring for Zero-Shot Aerial Vision-Language Navigation
CompilerKV: Risk-Adaptive KV Compression via Offline Experience Compilation
LinguistAgent Technical Report: A Reflective Multi-Model Platform for Automated Linguisti…
State Compression in Two-Agent LLM Relays: A Closed-World Study of Constraint Preservation
MUX: Continuous Reasoning via Multiplexed Tokens
ImplicitRDP: An End-to-End Visual-Force Diffusion Policy with Structural Slow-Fast Learni…
ProbSPARQL: Querying Knowledge Graphs with Multi-dimensional, Uncertain Numeric Data
FindStatBench: Evaluating Large Language Models on Combinatorial Code Synthesis
S2T-RLHF: Hierarchical Credit Assignment for Stable Preference-Based RLHF
Hyperdimensional Probe: Decoding LLM Representations via Vector Symbolic Architectures
PEARL: Solver-in-the-Loop Interactive Optimization Modeling from Natural Language
Cross-Dialect Generalization Without Retraining: Benchmarks and Evaluation of Schema-Deri…
Training and Simulation of Quadrupedal Robot in Adaptive Stair Climbing and Descending fo…
MILP-Evo: Closed-Loop Fully Automatic Design of MILP Solvers