Peer-Preservation in Frontier Models
Explorar
Noticias de IA
22318 elementos — filtrados, clasificados y sin duplicados
S2P-Net: A Spectral-Spatial Polar Network for Rotation-Invariant Object Recognition in Lo…
Mapping License Plate Recoverability Under Extreme Viewing Angles for Opportunistic Urban…
Hierarchical Fault Detection and Diagnosis for Transformer Architectures
How Do Tool-Augmented LLM Agents Perform on Real-World Energy Analytics Tasks?
What We are Missing in Multimodal LLM Evaluation?
OpenFinGym: A Verifiable Multi-Task Gym Environment for Evaluating Quant Agents
Data-driven Machine Learning Cannot Reach Symbolic-level Logical Reasoning -- The Limit o…
Clinical Harness for Governable Medical AI Skill Ecosystems
Humans Disengage, Reasoning Models Persist: Separating Difficulty Registration from Delib…
Data-Free Reservoir Features for Efficient Long-Horizon Cold-Start Continual Learning
Latent-Mark: An Audio Watermark Robust to Neural Codec Compression
Scalable AI-assisted Workflow Management for Detector Design Optimization Using Distribut…
Learning to Recover Task Experts from a Multi-Task Merged Model
Radical AI Interpretability
A Multi-Level Validation and Traceability Framework for AI-Generated Telescope Scheduling…
Autoformalization of Agent Instructions into Policy-as-Code
SKILL-DISCO: Distilling and Compiling Agent Traces into Reusable Procedural Skills
Where Do CoT Training Gains Land in LLM based Agents?
Einstein World Models
How to evaluate clustering with ground truth?
Joint Learning of Experiential Rules and Policies for Large Language Model Agents
TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation S…
WatchAct: A Benchmark for Behavior-Grounded Robot Manipulation
A Process Harness for Uplifting Legacy Workflows to Agentic BPM: Design and Realization i…
Ask, Don't Judge: Binary Questions for Interpretable LLM Evaluation and Self-Improvement
A Multi-Layer AI Framework for Information Landscape Analysis
Scientific discovery as meta-optimization: a combinatorial optimization case study
The Capability Frontier: Benchmarks Miss 82% of Model Performance
TAVR-VLM: Risk-Conditioned Causal Grounding for Hallucination-Resistant Report Generation