When Is Benchmark Contamination Detectable? Information Limits and Power-Calibrated Audits
Explorar
Noticias de IA
29336 elementos — filtrados, clasificados y sin duplicados
TongGuOCR: A Layout-Aware and Token-Augmented OCR Framework for Chinese Historical Docume…
Locating Failure in Multi-Page Visually Rich Document Understanding: An Empirical Attribu…
Beyond Pixels: Exploring DOM Downsampling for LLM-Based Web Agents
LAUDE: LLM-Assisted Unit Test Generation and Debugging of Hardware DEsigns
GraphThink: Graph-Enhanced LLM Thinking for Long-Horizon Embodied Task Planning
Directed Neuro-Symbolic Stochastic Execution for Verification of Distributed Parallel AI …
From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs
ZenBrain: A Neuroscience-Inspired 7-Layer Memory Architecture for Autonomous AI Systems
GRACE: LLM-Grounded Semantic Metric Spaces for Scalable Mixed-Data Clustering
Reason Wide, Not Deep: Amortizing the Reasoning Premium into Distilled Skills
CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning
Multilingual Agent-Based World Modeling for Social Science
Back to the Future: A workbook time machine for spread sheet creation benchmarks
TelemetrySuffBench: Is Agent Telemetry Sufficient for Failure-Origin Diagnosis?
Self-Evolving Neuro-Symbolic Skills for Tool-Augmented Spatial Reasoning
Who Built This Model? Tracing LLM Lineage via Spectral Fingerprints in Weight Space
The Capability Ladder: A Curriculum-Modernization Framework for Workforce Readiness in th…
CausalNav: Reliability-Certified Causal World Models for Control under Physical-Parameter…
When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-…
Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation
AndroidReality: How Far Are Mobile Agents from the Real World?
Counterfactual Benchmarking and Training for Factuality Consistency and Order-Robust Grou…
LEGO-Puzzles: How Good Are MLLMs at Multi-Step Spatial Reasoning?
Open-World Hierarchical Perception: Taxonomic Abstraction over Class-Agnostic Proposals f…
Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal …
Guixu: Valuation-Driven Data Discovery for Autonomous AI Agents with On-Chain Attestation
A Statistical Framework for Auditing Behavioral Dependence and Induced Bias in LLM Judges
Contextual Value Alignment via Multilayer Combinatorial Fusion
An Agentic AI Framework Overcomes Fundamental Limitations of Large Language Models for Gl…