Explorar

Noticias de IA

21863 elementos — filtrados, clasificados y sin duplicados

arXiv cs.AI Research & Papers
CORE: Conflict-Oriented Reasoning for General Multimodal Manipulation Detection
arXiv cs.AI Research & Papers
GTBench: A Curriculum-Grounded Benchmark for Evaluating LLMs as Mathematical Research Ass…
arXiv cs.AI Research & Papers
EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinfo…
arXiv cs.AI Research & Papers
Effect of Demographic Bias on Skin Lesion Classification
arXiv cs.AI Research & Papers
ClinicalMC: A Benchmark for Multi-Course Clinical Decision-Making with Large Language Mod…
arXiv cs.AI Research & Papers
Distilling Answer-Set Programming Rules from LLMs for Neurosymbolic Visual Question Answe…
arXiv cs.AI Research & Papers
The Reliability Gap in Benchmark Auditing: Distribution Shift and Scale as Failure Modes …
arXiv cs.AI Research & Papers
LEAP: Supercharging LLMs for Formal Mathematics with Agentic Frameworks
arXiv cs.AI Research & Papers
What Makes Interaction Trajectories Effective for Training Terminal Agents?
arXiv cs.AI Research & Papers
CP-Agent: Context-Aware Multimodal Reasoning for Cellular Morphological Profiling under C…
arXiv cs.AI Research & Papers
InfoMem: Training Long-Context Memory Agents with Answer-Conditioned Information Gain
arXiv cs.AI Research & Papers
The Violation Situation Pattern: A Knowledge-Graph Pattern for Compliance Violations
arXiv cs.AI Research & Papers
SAGE: A Quantitative Evaluation of Socialized Evolution in Agent Ecosystems
arXiv cs.AI Research & Papers
ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning
arXiv cs.AI Research & Papers
A formal definition and meta-model for a machine theory of mind
arXiv cs.AI Research & Papers
StepFinder: A Temporal Semantic Framework for Failure Attribution in Multi-Agent Systems
arXiv cs.AI Research & Papers
Gender-Dependent Diagnostic Substitution in LLM Medical Triage: Same Symptoms, Unequal Ur…
arXiv cs.AI Research & Papers
Cross-Lingual Token Arbitrage: Optimizing Code Agent Context Windows via Local LLM Prepro…
arXiv cs.AI Research & Papers
From Prompt to Service: An SLM-Based Agent Orchestration Gateway for AI-Driven Virtual Wo…
arXiv cs.AI Research & Papers
The DeepSpeak-Agentic Dataset
arXiv cs.AI Research & Papers
From Answers to States: Verifiable Process-Level Evaluation of Chemical Reasoning in Larg…
arXiv cs.AI Research & Papers
LAP: An Agent-to-Instrument Protocol for Autonomous Science
arXiv cs.AI Research & Papers
When to Re-Plan: Subgoal Persistence in Hierarchical Latent Reasoning
arXiv cs.AI Research & Papers
Unveiling the Structure of Do-Calculus Reasoning via Derivation Graphs
arXiv cs.AI Research & Papers
Leveraging BART to Assess CS1 C++ Programming Assignments using Rubric-based Criteria
arXiv cs.AI Research & Papers
From Control Boundary to Insurance Claim: Reconstructing AI-Mediated Losses Through the C…
arXiv cs.AI Research & Papers
Reasoning Structure of Large Language Models
arXiv cs.AI Research & Papers
PyraMathBench: Evaluating and Improving Mathematical Capability in Large Language Models
arXiv cs.AI Research & Papers
BigFinanceBench: A Workflow-Grounded Benchmark for Financial-Research Agents
arXiv cs.AI Research & Papers
IdiomX A Multilingual Benchmark for Idiom Understanding, Retrieval, and Interpretation