Selective-Advantage Entropy-Adaptive Horizon GRPO: Asymmetric Token-Level Discounting for…
Explorar
Noticias de IA
29349 elementos — filtrados, clasificados y sin duplicados
Willing but Unable: Separating Refusal from Capability in Code LLMs via Abliteration
Evaluating CUDA Tile for AI Workloads on Hopper and Blackwell GPUs
PLAN-S: Bridging Planning with Latent Style Dynamics for Autonomous Driving World Models
Boosting Brain-to-Image Decoding with TRIBE v2 Data Augmentation
Memory is Reconstructed, Not Retrieved: Graph Memory for LLM Agents
RAS: a Reliability Oriented Metric for Automatic Speech Recognition
Evaluating Agentic Configuration Repair for Computer Networks
Executable Schema Contracts: From Automatic Ingestion to Multi-Source Retrieval
Bridging Domain Expertise and Generalization for Performance Estimation
Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Roboti…
The Topological Trouble With Transformers
The Role of Instructional Guidance in Generative AI-Assisted Learning: Empirical Evidence…
The Score Hamiltonian: Mapping Diffusion Models to Adiabatic Transport
SoCRATES: Towards Reliable Automated Evaluation of Proactive LLM Mediation across Domains…
CausalPOI: Spatio-Temporal Graph-Based Causal Modeling for Cold-Start POI Check-in Foreca…
Benchmarking Emergent Coordination in Large-Scale LLM Populations: An Evaluation Framewor…
Towards Healthy Evolution: Exploring the Role and Mechanisms of Human-Agent Interaction i…
OneReason Technical Report
CogManip: Benchmarking Manipulative Behavior in Multi-Turn Interactions with Large Langua…
Soft Sequence Policy Optimization
When Tools Fail: Benchmarking Dynamic Replanning and Anomaly Recovery in LLM Agents
HANDOFF: Humanoid Agentic Task-Space Whole-Body Control via Distilled Complementary Teach…
Aligning Tree-Search Policies with Fixed Token Budgets in Test-Time Scaling of LLMs
SAGE: Scalable AI Governance & Evaluation
When Should Memory Stay Silent: Measuring Memory-Use Boundaries in Memory-Augmented Conve…
SpanNorm: Reconciling Training Stability and Performance in Deep Transformers
TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents
EasyLens: A Training-Free Plug-and-Play Subtle-Lesion Representation Amplifier for Medica…
Microskill Architecture: A Modular Skill-Driven Framework for AI-Native Code Generation