Explorar

Noticias de IA

29336 elementos — filtrados, clasificados y sin duplicados

arXiv cs.AI Research & Papers
When Is Benchmark Contamination Detectable? Information Limits and Power-Calibrated Audits
arXiv cs.AI Research & Papers
TongGuOCR: A Layout-Aware and Token-Augmented OCR Framework for Chinese Historical Docume…
arXiv cs.AI Research & Papers
Locating Failure in Multi-Page Visually Rich Document Understanding: An Empirical Attribu…
arXiv cs.AI Research & Papers
Beyond Pixels: Exploring DOM Downsampling for LLM-Based Web Agents
arXiv cs.AI Research & Papers
LAUDE: LLM-Assisted Unit Test Generation and Debugging of Hardware DEsigns
arXiv cs.AI Research & Papers
GraphThink: Graph-Enhanced LLM Thinking for Long-Horizon Embodied Task Planning
arXiv cs.AI Research & Papers
Directed Neuro-Symbolic Stochastic Execution for Verification of Distributed Parallel AI …
arXiv cs.AI Research & Papers
From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs
arXiv cs.AI Research & Papers
ZenBrain: A Neuroscience-Inspired 7-Layer Memory Architecture for Autonomous AI Systems
arXiv cs.AI Research & Papers
GRACE: LLM-Grounded Semantic Metric Spaces for Scalable Mixed-Data Clustering
arXiv cs.AI Research & Papers
Reason Wide, Not Deep: Amortizing the Reasoning Premium into Distilled Skills
arXiv cs.AI Research & Papers
CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning
arXiv cs.AI Research & Papers
Multilingual Agent-Based World Modeling for Social Science
arXiv cs.AI Research & Papers
Back to the Future: A workbook time machine for spread sheet creation benchmarks
arXiv cs.AI Research & Papers
TelemetrySuffBench: Is Agent Telemetry Sufficient for Failure-Origin Diagnosis?
arXiv cs.AI Research & Papers
Self-Evolving Neuro-Symbolic Skills for Tool-Augmented Spatial Reasoning
arXiv cs.AI Research & Papers
Who Built This Model? Tracing LLM Lineage via Spectral Fingerprints in Weight Space
arXiv cs.AI Research & Papers
The Capability Ladder: A Curriculum-Modernization Framework for Workforce Readiness in th…
arXiv cs.AI Research & Papers
CausalNav: Reliability-Certified Causal World Models for Control under Physical-Parameter…
arXiv cs.AI Research & Papers
When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-…
arXiv cs.AI Research & Papers
Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation
arXiv cs.AI Research & Papers
AndroidReality: How Far Are Mobile Agents from the Real World?
arXiv cs.AI Research & Papers
Counterfactual Benchmarking and Training for Factuality Consistency and Order-Robust Grou…
arXiv cs.AI Research & Papers
LEGO-Puzzles: How Good Are MLLMs at Multi-Step Spatial Reasoning?
arXiv cs.AI Research & Papers
Open-World Hierarchical Perception: Taxonomic Abstraction over Class-Agnostic Proposals f…
arXiv cs.AI Research & Papers
Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal …
arXiv cs.AI Research & Papers
Guixu: Valuation-Driven Data Discovery for Autonomous AI Agents with On-Chain Attestation
arXiv cs.AI Research & Papers
A Statistical Framework for Auditing Behavioral Dependence and Induced Bias in LLM Judges
arXiv cs.AI Research & Papers
Contextual Value Alignment via Multilayer Combinatorial Fusion
arXiv cs.AI Research & Papers
An Agentic AI Framework Overcomes Fundamental Limitations of Large Language Models for Gl…