Rethinking the Role of Tensor Decompositions in Post-Training LLM Compression
Explorar
Noticias de IA
27413 elementos — filtrados, clasificados y sin duplicados
QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards
Agentic Chain-of-Thought Steering for Efficient and Controllable LLM Reasoning
Exploiting Verification-Generation Gap: Test-Time Reinforcement Learning with Confidence-…
Humanoid-GPT: Scaling Data and Structure for Zero-Shot Motion Tracking
Formalizing the Binding Problem
VidMsg: A Benchmark for Implicit Message Inference in Short Videos
ASAP: Exploiting the Satisficing Generalization Edge in Neural Combinatorial Optimization
AlphaEval: A Comprehensive and Efficient Evaluation Framework for Formula Alpha Mining
Assistax: A Multi-Agent Hardware-Accelerated Reinforcement Learning Benchmark for Assisti…
FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on N…
Wavelet Fourier Diffuser: Frequency-Aware Diffusion Model for Reinforcement Learning
ProtocolBench: Which LLM MultiAgent Protocol to Choose?
RGMem: Renormalization Group-inspired Memory Evolution for Language Agents
MIND: Multi-rationale INtegrated Discriminative Reasoning Framework for Multi-modal Large…
Introduction to optimization methods for training SciML models
An Exploration of Collision-based Enemy Morphology Generation
Strongly Polynomial Time Complexity of Policy Iteration for $L_\infty$ Robust MDPs
A Scoping Review of the Ethical Perspectives on Anthropomorphising Large Language Model-B…
Test-Time Optimization of Physical Query Plans with LLMs
Causal Neural Probabilistic Circuits
Towards a Science of AI Agent Reliability
Who Deserves the Reward? SHARP: Shapley Credit-based Optimization for Multi-Agent System
Crystal: Characterizing Relative Impact of Scholarly Publications
Evaluating Relational Reasoning in LLMs with REL
Efficient Hyperparameter Optimization for LLM Reinforcement Learning
Efficient Temporal Datalog Materialisation for Composite Event Recognition
From Context to Skills: Can Language Models Learn from Context Skillfully?
$R^2$-dLLM: Accelerating Diffusion Large Language Models via Spatio-Temporal Redundancy R…
PnP-Corrector: A Universal Correction Framework for Coupled Spatiotemporal Forecasting