ASEval: Automated Trajectory-Level Security Testing for Autonomous Agents
Explorar
Noticias de IA
30591 elementos — filtrados, clasificados y sin duplicados
VTM-Nav: Harnessing Cross-Episode Experience for Object-Goal Navigation with Hierarchical…
Household Movement Detection in Mixed-Format Occupancy Data Using LLM-Based Entity Resolu…
Do Agent Benchmarks Measure Capability? Protocol Validity in the Age of Agentic AI
Agentic Root Cause Analysis through Evidence-Grounded Reasoning
SceneActBench: Can Agents Act on the 3D Scenes They See?
TRACE-ROUTER: Task-Consistent and Adaptive Online Routing for Agentic AI
The Regression Tax: Decomposing Why Skills Help and Hurt LLM Agents
Explainable Reinforcement Learning for assisting Air Traffic Controllers
Do emulated quantum circuits change what CNNs look at? Performance and explainability com…
Decoupled Attention Fusion: Accelerating RAG with Efficient KV Cache Reuse
Analyzing Middle School Students' Dialogue and Behaviors during Collaborative AI Chatbot …
A Systematic Survey on Image Description Techniques for STEM Domains
On the Depth Scalability of Logic Gate Networks
MotifRole-Diff: Risk-Optimal Role-Aware Corruption for Masked Molecular Graph Diffusion
Tool-Guided Retrieval-Augmented Repair for Securing LLM-Generated C Code
FrED: External Data Influence Estimation via Domain Knowledge Graph Grounding
Lost in Context: Addressing Context Anxiety in Large Language Models
Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models
LeafData: An Agentic System for Data Migration
From Profiles to Steering Vectors: Global Sparse Priors and Local Semantic Calibration fo…
FBLayout: Optimizing Memory Layout for Efficient LLM Finetuning on Mobile GPUs
Trajectory-Aware Retrieval Agents for Temporal Decision- Making
Securing Multimodal AI through Internal Information Decomposition
Risk Is Not the Target: A Monotonic Framework for Evaluating Wildfire Operational Risk Si…
Discrete Action Space as a Prerequisite for GRPO Convergence in Small-Model Continuous Co…
Do Modules Stay in Their Lane? Role Drift in Compound LLM Systems
Defining AI-Native Systems: Autonomy as Revision Authority
Persistent Computational State: A Session-Centric Runtime for Generative World Models
What AI Red-Team Evaluations Can and Cannot Prove