VERPO: Verified Evidence Regularized Policy Optimization
Explorar
Noticias de IA
27413 elementos — filtrados, clasificados y sin duplicados
Linear Algebra Foundations of Efficient Attention: A Phase Reversal in Rank Collapse Unde…
From Splats to Silicon: Rethinking Computational Efficiency of 3DGS
Quantization Amplifies Determinism, Not Bias: Scale-Dependent Behavioral Effects of Servi…
PopResume: Causal Fairness Evaluation of LLM/VLM Resume Screeners with Population-Represe…
Understanding the Impact of Model Pruning on Long-Tail Forgetting and Explanation Reliabi…
TimeBlind: A Spatio-Temporal Compositionality Benchmark for Video LLMs
The Role of Gradient Modification in Heavy-Tailed Nonconvex Stochastic Min-Max Optimizati…
MedGround: Bridging the Evidence Gap in Medical Vision-Language Models with Verified Grou…
Explainable Deep Learning for Price-Trade Dynamics: From Black-Box Forecasts to Effective…
SkillSpec: Intent-Masked Specification Reasoning for Agent Skill Correctness
FigEx2: Visual-Conditioned Panel Detection and Captioning for Scientific Compound Figures
Hypersolid: Emergent Vision Representations via Short-Range Repulsion
On BatchNorm Forward Modes in Value-Based Reinforcement Learning
SCRIPTIOC-BENCH: A Benchmark for Recognizing Actionable Threat Intelligence from Script-B…
Discovering Translation-Worthy Languages with E-Values
Parity, Sensitivity, and Transformers
Explainable Token-level Noise Filtering for LLM Fine-tuning Datasets
Attention-Weighted Value Projection for KV-Cache Compression
Solving versus Verifying: Catching Contradictions in Tax Reasoning Systems
Beyond Cross-Lingual Transfer: Benchmarking Propagation Boundaries in Multilingual LLM Un…
DART: Distributional Adversarial Recurrent Training for Algorithm Learning
STAR-Pro: Stage-Wise Token Adaptive Reduction with Progressive Refinement for Efficient L…
AVSplat: Dense-View Feed-Forward 3D Gaussian Splatting with Assist-View Preconditioning
Who Laughs with Whom? Disentangling Influential Factors in Humor Preferences across User …
Grounded and Faithful P&ID Reasoning: Constraining Vision-Language Models with Recovered …
What if LLMs Ate Their Words: Causal History Effects in Multi-Turn Interaction
AlignDiff: Exploiting Model-Intrinsic Information for Better Preference Data Selection
Memory in Deep Time-Series Models
Alpha-R1: Alpha Screening with LLM Reasoning via Reinforcement Learning