Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning
Explorar
Noticias de IA
27413 elementos — filtrados, clasificados y sin duplicados
CalBench: Evaluating Coordination-Privacy Trade-offs in Multi-Agent LLMs
CaC: Advancing Video Reward Models via Hierarchical Spatiotemporal Concentrating
AgentLens: Revealing The Lucky Pass Problem in SWE-Agent Evaluation
Many-Shot CoT-ICL: Making In-Context Learning Truly Learn
AttenA+: Rectifying Action Inequality in Robotic Foundation Models
ProtoMedAgent: Multimodal Clinical Interpretability via Privacy-Aware Agentic Workflows
GiPL: Generative augmented iterative Pseudo-Labeling for Cross-Domain Few-Shot Object Det…
PhoneWorld: Scaling Phone-Use Agent Environments
Source-Grounded Semantic Reinforcement Learning for Low-Resource Target-Language Generati…
Benchmarking Large Vision-Language Models on CFMME: A Comprehensive Chinese Financial Mul…
Composing Non-Conjugate Factor Graphs with Closed-Form Variational Inference
How Coding Agents Fail Their Users: A Large-Scale Analysis of Developer-Agent Misalignmen…
TRACER: Persistent Regularization for Robust Multimodal Finetuning
The Good, the Bad, and the Ugly of Markov Boundary for Tabular Prediction
EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents
Hilbert-Geo: Solving Solid Geometric Problems by Neural-Symbolic Reasoning
Self-Supervised Laplace Approximation for Bayesian Uncertainty Quantification
MedMosaic: A Challenging Large Scale Benchmark of Diverse Medical Audio
COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive …
Architecture-Induced Recoverability Bias in Differentiable Symbolic Regression
SERC: LDPC-Inspired Semantic Error Correction for Retrieval-Augmented Generation
Thoughts-as-Planning: Latent World Models for Chain-of-Thoughts Optimization via Reinforc…
Honest Lying: Understanding Memory Confabulation in Reflexive Agents
LLUMI: Improving LLM Writing Assistance for Mental Health Support with Online Community F…
Same Evidence, Different Answers: Canonical-Context On-Policy Distillation for Multi-Turn…
Reinforcement Learning with Robust Rubric Rewards
BORA: Bridging Offline Reinforcement Learning and Online Residual Adaptation for Real-Wor…
CalArena: A Large-Scale Post-Hoc Calibration Benchmark
Croissant Tasks: A Metadata Format for Reproducible Machine Learning Evaluations