InfoMem: Training Long-Context Memory Agents with Answer-Conditioned Information Gain
Explorar
Noticias de IA
27413 elementos — filtrados, clasificados y sin duplicados
The Violation Situation Pattern: A Knowledge-Graph Pattern for Compliance Violations
SAGE: A Quantitative Evaluation of Socialized Evolution in Agent Ecosystems
ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning
A formal definition and meta-model for a machine theory of mind
StepFinder: A Temporal Semantic Framework for Failure Attribution in Multi-Agent Systems
Gender-Dependent Diagnostic Substitution in LLM Medical Triage: Same Symptoms, Unequal Ur…
Cross-Lingual Token Arbitrage: Optimizing Code Agent Context Windows via Local LLM Prepro…
From Prompt to Service: An SLM-Based Agent Orchestration Gateway for AI-Driven Virtual Wo…
The DeepSpeak-Agentic Dataset
From Answers to States: Verifiable Process-Level Evaluation of Chemical Reasoning in Larg…
$R^2$-dLLM: Accelerating Diffusion Large Language Models via Spatio-Temporal Redundancy R…
LAP: An Agent-to-Instrument Protocol for Autonomous Science
When to Re-Plan: Subgoal Persistence in Hierarchical Latent Reasoning
Unveiling the Structure of Do-Calculus Reasoning via Derivation Graphs
Leveraging BART to Assess CS1 C++ Programming Assignments using Rubric-based Criteria
From Control Boundary to Insurance Claim: Reconstructing AI-Mediated Losses Through the C…
ProEval: Proactive Failure Discovery and Efficient Performance Estimation for Generative …
Reasoning Structure of Large Language Models
PyraMathBench: Evaluating and Improving Mathematical Capability in Large Language Models
BigFinanceBench: A Workflow-Grounded Benchmark for Financial-Research Agents
IdiomX A Multilingual Benchmark for Idiom Understanding, Retrieval, and Interpretation
Cost-Aware Query Routing in RAG: Empirical Analysis of Retrieval Depth Tradeoffs
Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models
Entropy Is Not Enough: Unlocking Effective Reinforcement Learning for Visual Reasoning vi…
Cross-Modal Contrastive Learning of ECG and Angiography Representations for Severe Stenos…
TadA-Bench: A Million-Variant Benchmark for Future-Round Discovery Toward Agentic Protein…
Closed-Loop Molecular Design with Calibrated Deference
CARVE: Certified Affordable Repair of Vetoed Maneuvers via Envelopes for Interactive Driv…
Sparse-View Lung Nodule Volumetry from Digitally Reconstructed Radiographs via AReT: Anat…