DRIFT: Difficulty Routing Self-DIstillation with Rhythm-Gated Exploration and Success BuF…
Explorar
Noticias de IA
27413 elementos — filtrados, clasificados y sin duplicados
Cognitive World Model for Progressive BDI/E Trajectory Evaluation of Conversational Agents
MirrorCraft: Paired Evaluation under Hidden Rule Changes in Minecraft
LLM Framework for Discovering Major Mathematical Conjectures: AI's Quest for the Next Rie…
TAPR: Enhancing LLM Performance with a Task-Aware Prompt Rewriter
FBFM: A Training-Free Asynchronous Feedback Mechanism for Flow-Matching in World-Action M…
Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL
An Ontology-Guided, Deduplication-Aware Extraction Layer for Knowledge Graph Construction…
MOSAIC: Masked Outsourcing of Secure AI Computations
FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Lan…
DualDiT: A Conditional Dual-Output Diffusion Transformer for Joint OCT Image and Segmenta…
SAF-OPD: Stable Advantage Fusion for On-Policy Distillation
How Hard Does It Think? Analyzing Step-Aware Reasoning Energy in LLM Chain-of-Thought Tra…
Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Aut…
Library Reachability in LSR-Synth: How Anti-Memorization Design Changes the Measurement o…
Safety, or Just Capability? A Validity Audit of Agent-Safety Benchmarks
Creative Integration: A Decidable Criterion of Creativity
Between Suppression and Collapse: Evaluating Narrative Unlearning with LENS
Scaling Scientific Discovery Environments for Turn-Level Agentic RL
When Model Priors Conflict with Visual Evidence: Mitigating Commonsense-Driven Hallucinat…
What Makes a Sale? Simulating End-to-End Seller--Buyer Retail Dynamics with LLM Agents
Beyond Component Testing: Validating Agentic AI Systems
Can AI Evaluate AI Scientists? A Benchmarking Study of Autonomous Research Generation Sys…
DragonCrawl: A Generative, Intent-Based Framework for Scalable Mobile End-to-End Testing
A user's guide to PINNs in geometric analysis: lessons from the asymptotic Plateau problem
Best Friends, Not Forever: Evaluating Long-Horizon Persona Collapse and Behavioral Drift …
MBDiff: Multi-view Behavior-aware Diffusion Model for Probabilistic Utility Data Imputati…
ActFovea: Runtime Safeguarding for VLA Policies via Spatiotemporal Visual-Action Consiste…
Fragility of Value under Imperfect Alignment
NeSyFS: A Neuro-symbolic Fast-Slow Thinking Framework for LLM Agent under Partial Observa…