KC-Bench: A Dynamic Interactive Benchmark for Evaluating Knowledge Conflicts in LLM Agents
Explorar
Noticias de IA
27413 elementos — filtrados, clasificados y sin duplicados
HalluPeer: A Taxonomy-driven Benchmark for Detecting Hallucinations in Scientific Peer Re…
Counterfactual Routing Using Integer Programming with Constraint Generation
GPS-Bench: A Governance Policy Benchmark for Automating Policy Analysis
The Attention Triangle in Audio-Video Models
CulturalMenuBench: Probing the Knowledge-Application Gap in Multimodal Culinary Reasoning
PPO-STGNN: A Proximal Policy Optimization Approach with Spatio-Temporal Graph Neural Netw…
What Matters for Aggressive Decoding-Time KV Eviction? Temporal Aggregation and Ranking P…
NeoRed: A Knowledge-Logic-Alignment Multimodal Large Language Model for Neonatal Respirat…
Analysis of Prompt Engineering for Drug Toxicity Prediction
Feature Reconfiguration With Visual Prior for Medical Lesion Segmentation
Adapting to Evolving Requirements: Agentic AI for Retail Supply Chain Operations
NeoMME: an efficient Multimodal-native and Multilingual Encoder
AI Mathematician: Towards Fully Automated Frontier Mathematical Research
Modeling and Optimizing User Preferences in AI Copilots: A Comprehensive Survey and Taxon…
Do Large Language Models Capture the Diversity in their Training Data?
RVSD: Retrieval Vision Sparse Decoding for Mitigating Visual Hallucinations in Large Visi…
TikZilla: Scaling Text-to-TikZ with High-Quality Data and Reinforcement Learning
Automated Vulnerability Injection in Smart Contracts Using Large Language Models
ProbeMatchDTI: Probe-Driven Multi-Scale Biochemical Pattern Matching for Drug-Target Inte…
MultiGhostBench: A Multilingual Benchmark for Long-Form LLM-Generated Text Attribution un…
Evidence for Shared Routing Geometry and Dynamics in Sparse Mixture-of-Experts
PolERo: Studying Political Evasion in Romanian
Competitive Market Behavior of LLMs
Fine-Grained Anomaly Perception in Wild UGC-Enhanced Images: A Comprehensive Dataset and …
PaperCompiler: Faithful Paper-to-Code Generation via Repository-Level Specification Compi…
CrashDiffuser: VLM-Guided Collision Intent Reasoning for Fine-Grained Safety-Critical Tra…
DiffuSearch: How Hybrid Trajectory Planning Benefits from Aligned Objectives in Diffusion…
Retrosynthesis of Synthetic Media for Explainable AI Provenance Forensics
Action abstractions for amortized sampling