Explorar

Noticias de IA

27413 elementos — filtrados, clasificados y sin duplicados

arXiv cs.AI Research & Papers
Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning
arXiv cs.AI Research & Papers
CalBench: Evaluating Coordination-Privacy Trade-offs in Multi-Agent LLMs
arXiv cs.AI Research & Papers
CaC: Advancing Video Reward Models via Hierarchical Spatiotemporal Concentrating
arXiv cs.AI Research & Papers
AgentLens: Revealing The Lucky Pass Problem in SWE-Agent Evaluation
arXiv cs.AI Research & Papers
Many-Shot CoT-ICL: Making In-Context Learning Truly Learn
arXiv cs.AI Research & Papers
AttenA+: Rectifying Action Inequality in Robotic Foundation Models
arXiv cs.AI Research & Papers
ProtoMedAgent: Multimodal Clinical Interpretability via Privacy-Aware Agentic Workflows
arXiv cs.AI Research & Papers
GiPL: Generative augmented iterative Pseudo-Labeling for Cross-Domain Few-Shot Object Det…
arXiv cs.AI Research & Papers
PhoneWorld: Scaling Phone-Use Agent Environments
arXiv cs.AI Research & Papers
Source-Grounded Semantic Reinforcement Learning for Low-Resource Target-Language Generati…
arXiv cs.AI Research & Papers
Benchmarking Large Vision-Language Models on CFMME: A Comprehensive Chinese Financial Mul…
arXiv cs.AI Research & Papers
Composing Non-Conjugate Factor Graphs with Closed-Form Variational Inference
arXiv cs.AI Research & Papers
How Coding Agents Fail Their Users: A Large-Scale Analysis of Developer-Agent Misalignmen…
arXiv cs.AI Research & Papers
TRACER: Persistent Regularization for Robust Multimodal Finetuning
arXiv cs.AI Research & Papers
The Good, the Bad, and the Ugly of Markov Boundary for Tabular Prediction
arXiv cs.AI Research & Papers
EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents
arXiv cs.AI Research & Papers
Hilbert-Geo: Solving Solid Geometric Problems by Neural-Symbolic Reasoning
arXiv cs.AI Research & Papers
Self-Supervised Laplace Approximation for Bayesian Uncertainty Quantification
arXiv cs.AI Research & Papers
MedMosaic: A Challenging Large Scale Benchmark of Diverse Medical Audio
arXiv cs.AI Research & Papers
COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive …
arXiv cs.AI Research & Papers
Architecture-Induced Recoverability Bias in Differentiable Symbolic Regression
arXiv cs.AI Research & Papers
SERC: LDPC-Inspired Semantic Error Correction for Retrieval-Augmented Generation
arXiv cs.AI Research & Papers
Thoughts-as-Planning: Latent World Models for Chain-of-Thoughts Optimization via Reinforc…
arXiv cs.AI Research & Papers
Honest Lying: Understanding Memory Confabulation in Reflexive Agents
arXiv cs.AI Research & Papers
LLUMI: Improving LLM Writing Assistance for Mental Health Support with Online Community F…
arXiv cs.AI Research & Papers
Same Evidence, Different Answers: Canonical-Context On-Policy Distillation for Multi-Turn…
arXiv cs.AI Research & Papers
Reinforcement Learning with Robust Rubric Rewards
arXiv cs.AI Research & Papers
BORA: Bridging Offline Reinforcement Learning and Online Residual Adaptation for Real-Wor…
arXiv cs.AI Research & Papers
CalArena: A Large-Scale Post-Hoc Calibration Benchmark
arXiv cs.AI Research & Papers
Croissant Tasks: A Metadata Format for Reproducible Machine Learning Evaluations