Toward Safe LLM Agents: A Survey of Specification, Verification, and Enforcement
Explorar
Noticias de IA
27413 elementos — filtrados, clasificados y sin duplicados
Euclid-Omni : A Unified Neuro-Symbolic Framework for Plane Geometry
An Agentic Framework Using Rules and LLMs for Embedding and Annotating Descriptive Docume…
The Hallucination Snowball: Modeling Error Propagation as State Transitions in Multi-Agen…
When Do LLMs Apply the Wrong Law? Diagnosing LLM Failures in Temporal Legal Reasoning
Do LLM Agents Negotiate Rationally? A Mechanism-Design Framework for Verifiable Multi-Age…
Large Language Models and their Awareness of Mechanics and Spatial Geometry
A Human-Centred Approach to Benchmarking LLMs for Parenting Advice
Learning Agent Execution for KV-Cache Management in Agentic Serving
Task- and Session-Level Model Routing: A Common-Interface Hybrid Evaluation of Four Open-…
Accuracy and Reliability of Large Language Models in Cosmetic Chemistry and Skin Health: …
Evaluating Multimodal LLMs across Text and Audio Modalities for Accessible Disaster Assis…
When Uncertainty Isn't Enough: An Empirical Study of Self-Correction in Code Generation
Cross-Domain Industrial Fault Detection by Causal Mechanism Monitoring
When Agentic Executions Fail: Detecting and Localizing Runtime Faults from Telemetry
A Comprehensive Survey of Wireless Foundation Models for AI-Native 6G Networks
OceanLight: Efficient Global Ocean Forecasting via Geometry-Adaptive Unstructured Mesh Re…
Beyond Pass@k: Measuring Reliability and Security of Agentic Code Generation
Advanced modelling and data analytics in aviation
Agentic Data Cleaning Without a Clean Reference: An Experimental Study of Capabilities an…
CEDAR-GRPO: Process-Aware Reinforcement Learning for General Abductive Reasoning in LLMs
Generated Context versus Governed State: Functional Conditions for Accountable Longitudin…
MINT: Min-Selection Preference Distillation for Balanced Multi-Objective Alignment
What the Reranker Sees: Multi-Aspect Page Annotation for Long-Document Multimodal Questio…
Personalized Auto-Research: Towards a True AI Co-Scientist
Frontier AI Forecasting Has a Measurement Problem: An Audit of Progress Evidence
LLMs Can Predict Failure Risk, But Struggle to Predict Which Collaboration Protocol Pays …
Small Models Scout Bottleneck Order for Large-Model Data Control
Skill Blocks: How Should an Agent Load Its Skill? A Caching-Correct Comparison of Pre-loa…
Trust Is Not Enough: Influence Calibration for On-Policy Self-Distillation in Agentic RL