Explorar

Noticias de IA

29627 elementos — filtrados, clasificados y sin duplicados

arXiv cs.AI Research & Papers
SIFT: Selective-Index For Fast Compute of RAG Prefill by Exploiting Attention Invariance
arXiv cs.AI Research & Papers
WeaveBench: A Long-Horizon, Real-World Benchmark for Computer-Use Agents with Hybrid Inte…
arXiv cs.AI Research & Papers
MixReasoning: Switching Modes to Think
arXiv cs.AI Research & Papers
Capacity, Not Format: Rethinking Structured Reasoning Failures
arXiv cs.AI Research & Papers
Correct Looks Better: Pairwise Comparisons Reveal Accuracy Rankings
arXiv cs.AI Research & Papers
RunAgent SuperBrowser: A Theory of Autonomous Web Navigation Grounded in Human Browsing B…
arXiv cs.AI Research & Papers
Discovering heuristics in a complex SAT solver with large language models
arXiv cs.AI Research & Papers
Experience Makes Skillful: Enabling Generalizable Medical Agent Reasoning via Self-Evolvi…
arXiv cs.AI Research & Papers
TRL-Bench: Standardizing Cross-Paradigm Representation-Level Evaluation of Tabular Encode…
arXiv cs.AI Research & Papers
MASS: Deep Research for Social Sciences with Memory-Augmented Social Simulation
arXiv cs.AI Research & Papers
Modeling the Diachronic Evolution of Legal Norms: An LRMoo-Based, Component-Level, Event-…
arXiv cs.AI Research & Papers
FieldWorkArena: Agentic AI Benchmark for Real Field Work Tasks
arXiv cs.AI Research & Papers
Can Global XAI Methods Reveal Injected Behaviours in LLMs? SHAP vs Rule Extraction vs Rul…
arXiv cs.AI Research & Papers
HA-VLN 2.0: An Open Benchmark and Leaderboard for Human-Aware Navigation in Discrete and …
arXiv cs.AI Research & Papers
TQA-Bench: Evaluating LLMs for Multi-Table Question Answering
arXiv cs.AI Research & Papers
Reliable to Expressive: A Curriculum for Rubric-Following Safety Judges
arXiv cs.AI Research & Papers
OmniGameArena: A Unified UE5 Benchmark for VLM Game Agents with Improvement Dynamics
arXiv cs.AI Research & Papers
PTL-Diffusion: Manifold-Aware Diffusion with Periodic Terminal Laws
arXiv cs.AI Research & Papers
Topological Neural Operators
arXiv cs.AI Research & Papers
Bandits for Efficient Experimentation: Adapting to Control Group, Preferences, and Contex…
arXiv cs.AI Research & Papers
Data Synthesis and Parameter-Efficient Fine-Tuning for Low-Resource NMT: A Case Study on …
arXiv cs.AI Research & Papers
MemToolAgent overview with a simple restaurant booking scenario where the agent retrieves…
arXiv cs.AI Research & Papers
Vision Language Model Helps Private Information De-Identification in Vision Data
arXiv cs.AI Research & Papers
The CIFAR Synthetic Evidence Corpus for Detecting AI-Generated Evidence
arXiv cs.AI Research & Papers
Difference-Aware Retrieval Policies for Imitation Learning
arXiv cs.AI Research & Papers
Learning to Attack and Defend: Adaptive Red Teaming of Language Models via GRPO
arXiv cs.AI Research & Papers
Observability for Delegated Execution in Agentic AI Systems
arXiv cs.AI Research & Papers
MeCo: One-Step MeanFlow-based Corrector for Multi-Channel Speech Separation
arXiv cs.AI Research & Papers
Online Agent-as-a-Judge: Situation-Generating Evaluation for Interactive Agents
arXiv cs.AI Research & Papers
End-to-End Context Compression at Scale