Towards Evaluation Engineering: An Empirical Study of ML Evaluation Harnesses in the Wild
Browse
AI News
30934 items — filtered, classified, deduplicated
A Comprehensive Dataset for Human vs. AI Generated Image Detection
Coupled Variational Reinforcement Learning for Language Model General Reasoning
Asking LLMs to Verify First is Almost Free Lunch
DeepEN: A Deep Reinforcement Learning Framework for Personalized Enteral Nutrition in Cri…
Auditing medical multi-agent AI reveals risks of false consensus
KAME: Tandem Architecture for Enhancing Knowledge in Real-Time Speech-to-Speech Conversat…
Spacetime Formation under Requirements: Contextual Realization and Form-Dependent Probabi…
Human-1 by Josh Talks: A Full-Duplex Conversational Modeling Framework in Hindi using Rea…
Rethinking the Comparison Unit in Sequence-Level Reinforcement Learning: An Equal-Length …
Music Interpretation and Emotion Perception: A Computational and Neurophysiological Inves…
Subspace Aggregation Query and Index Generation for Multidimensional Resource Space Model
Message-Passing GNNs Fail to Approximate Sparse Triangular Factorizations
Uncovering Autoregressive LLM Knowledge of Thematic Fit in Event Representation
HEAPr: Hessian-based Efficient Atomic Expert Pruning in Output Space
VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes
SpecPrune-VLA: Accelerating Vision-Language-Action Models via Action-Aware Self-Speculati…
HiTeC: Hierarchical Contrastive Learning on Text-Attributed Hypergraph with Semantic-Awar…
Designing Singing Syllabi with Virtual Avatars: AI-Assisted Syllabus Reauthoring
MCPXKIT: The Unified Toolkit for Analyzing Model Context Protocol Security
ToolRegistry: A Protocol-Agnostic Tool Management Library for Function-Calling LLMs
From Reasoning to Code: GRPO Optimization for Underrepresented Languages
Beyond the Proxy: Trajectory-Distilled Guidance for Offline GFlowNet Training
ECUAS$_n$: A family of metrics for principled evaluation of uncertainty-augmented systems
Is VLA Reasoning Faithful? Probing Safety of Chain-of-Causation in Autonomous Driving Mod…
ScrapMem: A Bio-inspired Framework for On-device Personalized Agent Memory via Optical Fo…
Shepherd: A Runtime Substrate Empowering Meta-Agents with a Formalized Execution Trace
ClawTrace: Cost-Aware Tracing for LLM Agent Skill Distillation
Multi-Modal Cross-Domain Alignment Network for Video Moment Retrieval
WorldGUI: An Interactive Benchmark for Desktop GUI Automation from Any Starting Point