CORE: Conflict-Oriented Reasoning for General Multimodal Manipulation Detection
Explorar
Noticias de IA
21863 elementos — filtrados, clasificados y sin duplicados
GTBench: A Curriculum-Grounded Benchmark for Evaluating LLMs as Mathematical Research Ass…
EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinfo…
Effect of Demographic Bias on Skin Lesion Classification
ClinicalMC: A Benchmark for Multi-Course Clinical Decision-Making with Large Language Mod…
Distilling Answer-Set Programming Rules from LLMs for Neurosymbolic Visual Question Answe…
The Reliability Gap in Benchmark Auditing: Distribution Shift and Scale as Failure Modes …
LEAP: Supercharging LLMs for Formal Mathematics with Agentic Frameworks
What Makes Interaction Trajectories Effective for Training Terminal Agents?
CP-Agent: Context-Aware Multimodal Reasoning for Cellular Morphological Profiling under C…
InfoMem: Training Long-Context Memory Agents with Answer-Conditioned Information Gain
The Violation Situation Pattern: A Knowledge-Graph Pattern for Compliance Violations
SAGE: A Quantitative Evaluation of Socialized Evolution in Agent Ecosystems
ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning
A formal definition and meta-model for a machine theory of mind
StepFinder: A Temporal Semantic Framework for Failure Attribution in Multi-Agent Systems
Gender-Dependent Diagnostic Substitution in LLM Medical Triage: Same Symptoms, Unequal Ur…
Cross-Lingual Token Arbitrage: Optimizing Code Agent Context Windows via Local LLM Prepro…
From Prompt to Service: An SLM-Based Agent Orchestration Gateway for AI-Driven Virtual Wo…
The DeepSpeak-Agentic Dataset
From Answers to States: Verifiable Process-Level Evaluation of Chemical Reasoning in Larg…
LAP: An Agent-to-Instrument Protocol for Autonomous Science
When to Re-Plan: Subgoal Persistence in Hierarchical Latent Reasoning
Unveiling the Structure of Do-Calculus Reasoning via Derivation Graphs
Leveraging BART to Assess CS1 C++ Programming Assignments using Rubric-based Criteria
From Control Boundary to Insurance Claim: Reconstructing AI-Mediated Losses Through the C…
Reasoning Structure of Large Language Models
PyraMathBench: Evaluating and Improving Mathematical Capability in Large Language Models
BigFinanceBench: A Workflow-Grounded Benchmark for Financial-Research Agents
IdiomX A Multilingual Benchmark for Idiom Understanding, Retrieval, and Interpretation