GUI-CC: Benchmarking Contextual Consistency of GUI World Models as Agent Environments
Explorar
Noticias de IA
37834 elementos — filtrados, clasificados y sin duplicados
A Formal Analysis of Agent Payment Protocols
SciTrue: Reliable Scientific Claim Validation with Frontier and Open Language Models at t…
Do Multimodal LLMs See Before They Read? Diagnosing Contextual Sycophancy
RePro: Proof-Verified Benchmark Rewriting for Reliable Evaluation of LLM Mathematical Pro…
RestoreBench: Can AI Agents Restore Power Flow Convergence?
Runtime-Independent Persistent Agents: Preserving Identity, Memory, and Code Across Model…
trajectory-judge: What Outcome-Only LLM Judges Miss on Agent Trajectories
Behaviorally Grounded User Profiles from the Wild for Personalized Alignment and Multi-Pe…
Asymmetries in Spontaneous and Instructed Deception
When Features Become Instances: Inverted Contrastive Learning for Unsupervised Feature Se…
ValueGraph: Value-Signal Guided Graph Pre-training for Contextualized User Representation
StudyBench: Can Self-Evolution Squeeze Textbooks for Olympiad Capability?
Don't Let the Model Write the YAML: Deterministic, Minimal-Diff GitOps Remediation from L…
In-Context Neurofeedback: Can LLMs Control Their Internal Representations through Privile…
EvoSCM: Scientific Belief Revision Through Causal Model Evolution and Experimentation
When Prediction Error Is Not Enough: Evaluating Nuisance-Function Prediction for Causal E…
Different representation learning objectives recover distinct latent structures from the …
Authority Bias in Conversational Search Engines for Academic Paper Recommendation
Neurosymbolics for Data Engineering: Achieving Long Context Token Reduction Without Finet…
Invalidation Contracts for Cross-Episode Agent Memory
The Irreversibility Budget: Fleet-Level Risk Accounting and Admission Control for Agent O…
EM^2Mem: Event-Centric Multimodal Memory for Large Language Models
Denoising Diffusion Generative Models Secretly Calculate Attentions
Residual Sparsification via Output Importance for Compressing Mixture-of-Experts LLMs
REVISE: Validity-Guided Recovery for Online Revisions in Agent Workflows
Same Request, Different Boundary: Evaluating Cybersecurity Assistance across Conversation…
EULER: Exploring Underused Links with Evidence-Checked Return for Multi-Agent Mathematica…
Vision Is Not Overhead: One-Pass Block Drafting for Lossless Speculative Decoding in Visi…
A Mathematical Framework for Legacy, Governance, and Decision Integrity in Enterprise AI