Explorar

Noticias de IA

37834 elementos — filtrados, clasificados y sin duplicados

arXiv cs.AI Research & Papers
Towards Standardized Evaluation in Automated Domain Modeling: Introducing a Benchmark
arXiv cs.AI Research & Papers
The Benchmark Trap: Structures of Power and Injustice in AI Evaluations
arXiv cs.AI Research & Papers
Admission Without Answers: Label-Free Certification and Experience Learning for LLM-Based…
arXiv cs.AI Research & Papers
Platform Adaptation Under Governance Interventions: Actor Best-Response Modeling and an E…
arXiv cs.AI Research & Papers
When Do LLMs Apply the Wrong Law? Diagnosing LLM Failures in Temporal Legal Reasoning
arXiv cs.AI Research & Papers
ACTS-SQL: Agentic and Critic-Oriented Tree-Structured SQL Correctness with Large Language…
arXiv cs.AI Research & Papers
LLMs Get Smarter from Targeted Synthetic Multilingual Data
arXiv cs.AI Research & Papers
A Network-driven Framework for Public Event Forecasting via Dynamic Interaction Network E…
arXiv cs.AI Research & Papers
An Agentic Framework Using Rules and LLMs for Embedding and Annotating Descriptive Docume…
arXiv cs.AI Research & Papers
Who Leads Now? Token-Level Modality Arbitration for Chart-to-Code Generation
arXiv cs.AI Research & Papers
Large Language Models Show Metacognitive Sensitivity in Medical Reasoning
arXiv cs.AI Research & Papers
Understanding and Stabilizing Deep Q-Learning via Controlled Bootstrapping and Regulated …
arXiv cs.AI Research & Papers
FLOPs vs Real Work: The Importance of Replication in AI Efficiency Assessment
arXiv cs.AI Research & Papers
Do LLMs Know What to Ask and When? Evaluating Multi-Turn Information Seeking
arXiv cs.AI Research & Papers
Discovering High-Quality Chess Puzzles with Offline Reinforcement Learning
arXiv cs.AI Research & Papers
From Errors to Proofs: Minimal-Core-Guided Repair for Neuro-Symbolic Constraint Solving
arXiv cs.AI Research & Papers
LongDocBench: Benchmarking TOC Hierarchy and Contextual Relationship Recovery in Long Doc…
arXiv cs.AI Research & Papers
Auditing an AI-Generated Mathematical Proof: A Correction to a Greedy Conditioning Lemma …
arXiv cs.AI Research & Papers
Semantic Uncertainty-Guided Orchestration in Hierarchical Multi-Agent Systems
arXiv cs.AI Opinion & Editorial
Position: AI Agents in Scientific Teams Should Be Studied as Human-Agent Systems
arXiv cs.AI Research & Papers
JarvisBench: Always-on Intelligence Between Humans and Agents
arXiv cs.AI Opinion & Editorial
Position: AI Lock-In Is in Progress, and We Must Be Prepared
arXiv cs.AI Research & Papers
Unraveling the Size Determination Mechanism of Nanocrystal Synthesis via Interpretable Ne…
arXiv cs.AI Research & Papers
PolyComp: A Polycube-based Benchmark for Compositional 3D Spatial Reasoning in Multimodal…
arXiv cs.AI Opinion & Editorial
Position: Certified Correctness in Neural Constraint Reasoning Requires Symbolic Integrat…
arXiv cs.AI Research & Papers
Beyond Correctness: Toward Automated Novelty Verification with Lean 4
arXiv cs.AI Research & Papers
Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Mo…
arXiv cs.AI Research & Papers
AgentMV: A State-Guided Multi-Agent Framework for Budget-Aware Music Video Generation
arXiv cs.AI Research & Papers
Do Personalized Skills Help Coding Agents? An Empirical Study of Developer Interaction Hi…
arXiv cs.AI Research & Papers
Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-…