Reinforcement Learning for Flow-Matching Policies with Density Transport
Explorar
Noticias de IA
22114 elementos — filtrados, clasificados y sin duplicados
Auditable Graph-Guided Root Cause Analysis for Kubernetes Incidents
Calibration of Structured Ignorance Certificates for Diagnosing Unknown Unknowns in Reaso…
EinSort: Sorting is All We Need for Tensorizing LLM
When Video Misreads: Closed-Loop Distillation of Reading Heuristics for Exploratory Manip…
ActProbe: Action-Space Probe for Early Failure Detection of Generative Robot Policies
STELLAR: Spatio-Temporal Environmental Learning with Latent Alignment and Refinement for …
PIPE-Cypher: Automatic Enterprise Benchmark Generation for Text-to-Cypher Systems
Adaptive Loss Balancing for Noise-Robust GRPO in Generative Recommendation
FlashCP: Load-Balanced Communication-Efficient Context Parallelism for LLM Training
AgentTrust: A Self-Improving Trust Layer for AI-Agent Actions
PAEC: Position-Aware Entropy Calibration for LLM Reasoning in RLVR
Sycophancy as a Multilingual Alignment Failure: How Safety Degrades Across Languages, Top…
Distilling LLM Reasoning into an Interpretable Policy Tree for Human-AI Collaboration
Sparrow: Sparse Rollout for Stable and Efficient Long-context RL of Large Language Models
Hacking Generative Perplexity: Why Unconditional Text Evaluation Needs Distributional Met…
InA-Probe: Instruction-Aware Active Probing for Time Series Forecasting with LLMs
PACT: Self-Evolving Physical Safety Alignment for Diffusion Policies in Embodied Manipula…
TimpaTeks: Automatic In-place Text Sequence Modification via Diffusion Language Model Ste…
SceneConductor: 3D Scene Generation from Single Image with Multi-Agent Orchestration
Extending Ontologies: From Dense Embeddings to Hybrid Quantum-Fuzzy Systems
STAR-KV: Low-Rank KV Cache Compression via Soft Thresholding for Adaptive Rank Control
Emergence World: A Platform for Evaluating Long-Horizon Multi-Agent Autonomy
ConMem: Structured Memory-Guided Adaptation in Training-Free Multi-Agent Systems
Structure-Conditioned Actor-Critic Branches for Quality-Diversity Reinforcement Learning
Pre-Intervention Prediction of Sparse Autoencoder Steering Side Effects
Bridging Expert Knowledge and Automated Feature Engineering via Self-Evolution
Generative Frontier Planning for Adaptive Peer-Referral Recruitment under Covariate-Depen…
Q-Delta: Beyond Key-Value Associative State Evolution
Set-Based Transformer for Atmospheric Compensation in Standoff LWIR Hyperspectral Imaging