ClinHallu: A Benchmark for Diagnosing Stage-Wise Hallucinations in Medical MLLM Reasoning
Explorar
Noticias de IA
30239 elementos — filtrados, clasificados y sin duplicados
Learning optimal policies from event logs through reinforcement learning: a comparison of…
Generative AI for Managerial Decision-Making under Ambiguity and Sycophancy
Learning Developmental Scaffoldings to Guide Self-Organisation
Quantile-Free Uncertainty Quantification in Graph Neural Networks
Application of Artificial Intelligence and Machine Learning in Libraries: A Systematic Re…
Fractured Chain-of-Thought Reasoning
Sentinel: Decoding Context Utilization via Attention Probing for Efficient LLM Context Co…
TabKD: Tabular Knowledge Distillation through Interaction Diversity of Learned Feature Bi…
From Sorting Algorithms to Scalable Kernels: Bayesian Optimization in High-Dimensional Pe…
HyperPotter: Spell the Charm of High-Order Interactions in Audio Deepfake Detection
Metabolic cost of information processing in Poisson variational autoencoders
Generalized Discrete Diffusion with Self-Correction
Expert-Driven Survival Machines: Improving Stratification and Interpretability in Multipl…
Low-Burden LLM-Based Preference Learning: Personalizing Assistive Robots from Natural Lan…
Can LLMs Accurately Score Medical Diagnoses and Clinical Reasoning?
The Weight Norm Sets the Grokking Timescale: A Causal Delay Law
YeasierAgent: Agentic Social Sandbox as a Canvas for Intent-Driven Creation of Platform-A…
Poker Arena: Multi-Axis Profiling of Strategic Reasoning and Memory in LLMs
Hyperdimensional computing for structured querying on tabular data embeddings
VISTA: View-Consistent Self-Verified Training for GUI Grounding
Simplex-Constrained Sparse Bagging: Transitioning from Uniform Priors to Sparse Posterior…
SuperThoughts: Reasoning Tokens in Superposition
Learning to Hear Hesitation: Continual Learning for Disfluency-Aware ASR
Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning St…
CADET: Physics-Grounded Causal Auditing and Training-Free Deconfounding of End-to-End Dri…
tap: A File-Based Protocol for Heterogeneous LLM Agent Collaboration
Cross-Dataset Bloom Question Classification: Supervised Models and Prompted LLMs
The Coin Flip Judge? Reliability and Bias in LLM-as-a-Judge Evaluation
An Agentic Retrieval Framework for Autonomous Context-Aware Data Quality Assessment