Explorar

Noticias de IA

27413 elementos — filtrados, clasificados y sin duplicados

arXiv cs.AI Research & Papers
Personalized Auto-Research: Towards a True AI Co-Scientist
arXiv cs.AI Research & Papers
Frontier AI Forecasting Has a Measurement Problem: An Audit of Progress Evidence
arXiv cs.AI Research & Papers
LLMs Can Predict Failure Risk, But Struggle to Predict Which Collaboration Protocol Pays …
arXiv cs.AI Research & Papers
Small Models Scout Bottleneck Order for Large-Model Data Control
arXiv cs.AI Research & Papers
Skill Blocks: How Should an Agent Load Its Skill? A Caching-Correct Comparison of Pre-loa…
arXiv cs.AI Research & Papers
Trust Is Not Enough: Influence Calibration for On-Policy Self-Distillation in Agentic RL
arXiv cs.AI Research & Papers
T-LLM Compiler: Trusted LLM-based Code Optimization and Verification Framework
arXiv cs.AI Research & Papers
Does a Tool Result Carry More Authority Than Plain Text? Three Prospective Studies of Fal…
arXiv cs.AI Research & Papers
S2-MoE: Enabling Efficient Self-Speculative Decoding for Mixture-of-Experts on Edge Devic…
arXiv cs.AI Research & Papers
Gathered, Not Admitted: How Attention Brings a Latent Variable into Verbalizable Form
arXiv cs.AI Research & Papers
Enhancing Science Classroom Discourse Analysis through Joint Multi-Task Learning for Reas…
arXiv cs.AI Research & Papers
TRACE-Bench: Decomposing and Diagnosing Multi-Reference Image Generation
arXiv cs.AI Research & Papers
Andy: A Mathematical Agent for Rigorous Proof and Autonomous Research
arXiv cs.AI Research & Papers
CEDAR-GRPO: Process-Aware Reinforcement Learning for General Abductive Reasoning in LLMs
arXiv cs.AI Research & Papers
RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
arXiv cs.AI Research & Papers
GraphLoom: Reliability-Calibrated Graph Evidence Routing for Multimodal KG-RAG
arXiv cs.AI Research & Papers
Funnel of Thoughts: Efficient Test-Time Scaling via Early Voting and Rollout Pruning
arXiv cs.AI Research & Papers
Evo-Harness: Context-to-Harness Skill Compilation for Self-Evolving Agents
arXiv cs.AI Research & Papers
Beyond Thresholds: A Quality-Aware Decision Intelligence Framework for Cold Chain IoT Sys…
arXiv cs.AI Research & Papers
StateM: Reaching 95.3% Raw Accuracy, or a \$15 Frontier Run, on Terminal-Bench 2.1 via Ha…
arXiv cs.AI Research & Papers
Agentic Data Cleaning Without a Clean Reference: An Experimental Study of Capabilities an…
arXiv cs.AI Research & Papers
Advanced modelling and data analytics in aviation
arXiv cs.AI Research & Papers
Second-Order Policy Effects as State Transitions: A Source-Linked Benchmark for Policy Si…
arXiv cs.AI Research & Papers
Anatomy of a Quantized Agent: VRAM Stability and Forecasting in Code-Synthesis Agentic Wo…
arXiv cs.AI Research & Papers
Flow Motion Policy: Manipulator Motion Planning with Flow Matching Models
arXiv cs.AI Research & Papers
I-CALM: Incentivizing Confidence-Aware Abstention for LLM Selective Answering
arXiv cs.AI Research & Papers
Beyond Pass@k: Measuring Reliability and Security of Agentic Code Generation
arXiv cs.AI Research & Papers
VFIG: Vectorizing Complex Figures in SVG with Vision-Language Models
arXiv cs.AI Research & Papers
ReForge: Keeping ABR Algorithms Never Finished with Verified Large Language Model Edits
arXiv cs.AI Research & Papers
Translating finite-domain integer constraint models to CP/SMT/ILP/PB/SAT solvers with CPM…