Explorar

Noticias de IA

27413 elementos — filtrados, clasificados y sin duplicados

arXiv cs.AI Research & Papers
Toward Safe LLM Agents: A Survey of Specification, Verification, and Enforcement
arXiv cs.AI Research & Papers
Euclid-Omni : A Unified Neuro-Symbolic Framework for Plane Geometry
arXiv cs.AI Research & Papers
An Agentic Framework Using Rules and LLMs for Embedding and Annotating Descriptive Docume…
arXiv cs.AI Research & Papers
The Hallucination Snowball: Modeling Error Propagation as State Transitions in Multi-Agen…
arXiv cs.AI Research & Papers
When Do LLMs Apply the Wrong Law? Diagnosing LLM Failures in Temporal Legal Reasoning
arXiv cs.AI Research & Papers
Do LLM Agents Negotiate Rationally? A Mechanism-Design Framework for Verifiable Multi-Age…
arXiv cs.AI Research & Papers
Large Language Models and their Awareness of Mechanics and Spatial Geometry
arXiv cs.AI Research & Papers
A Human-Centred Approach to Benchmarking LLMs for Parenting Advice
arXiv cs.AI Research & Papers
Learning Agent Execution for KV-Cache Management in Agentic Serving
arXiv cs.AI Research & Papers
Task- and Session-Level Model Routing: A Common-Interface Hybrid Evaluation of Four Open-…
arXiv cs.AI Research & Papers
Accuracy and Reliability of Large Language Models in Cosmetic Chemistry and Skin Health: …
arXiv cs.AI Research & Papers
Evaluating Multimodal LLMs across Text and Audio Modalities for Accessible Disaster Assis…
arXiv cs.AI Research & Papers
When Uncertainty Isn't Enough: An Empirical Study of Self-Correction in Code Generation
arXiv cs.AI Research & Papers
Cross-Domain Industrial Fault Detection by Causal Mechanism Monitoring
arXiv cs.AI Research & Papers
When Agentic Executions Fail: Detecting and Localizing Runtime Faults from Telemetry
arXiv cs.AI Research & Papers
A Comprehensive Survey of Wireless Foundation Models for AI-Native 6G Networks
arXiv cs.AI Research & Papers
OceanLight: Efficient Global Ocean Forecasting via Geometry-Adaptive Unstructured Mesh Re…
arXiv cs.AI Research & Papers
Beyond Pass@k: Measuring Reliability and Security of Agentic Code Generation
arXiv cs.AI Research & Papers
Advanced modelling and data analytics in aviation
arXiv cs.AI Research & Papers
Agentic Data Cleaning Without a Clean Reference: An Experimental Study of Capabilities an…
arXiv cs.AI Research & Papers
CEDAR-GRPO: Process-Aware Reinforcement Learning for General Abductive Reasoning in LLMs
arXiv cs.AI Research & Papers
Generated Context versus Governed State: Functional Conditions for Accountable Longitudin…
arXiv cs.AI Research & Papers
MINT: Min-Selection Preference Distillation for Balanced Multi-Objective Alignment
arXiv cs.AI Research & Papers
What the Reranker Sees: Multi-Aspect Page Annotation for Long-Document Multimodal Questio…
arXiv cs.AI Research & Papers
Personalized Auto-Research: Towards a True AI Co-Scientist
arXiv cs.AI Research & Papers
Frontier AI Forecasting Has a Measurement Problem: An Audit of Progress Evidence
arXiv cs.AI Research & Papers
LLMs Can Predict Failure Risk, But Struggle to Predict Which Collaboration Protocol Pays …
arXiv cs.AI Research & Papers
Small Models Scout Bottleneck Order for Large-Model Data Control
arXiv cs.AI Research & Papers
Skill Blocks: How Should an Agent Load Its Skill? A Caching-Correct Comparison of Pre-loa…
arXiv cs.AI Research & Papers
Trust Is Not Enough: Influence Calibration for On-Policy Self-Distillation in Agentic RL