Mind the Sim2Real Gap in User Simulation for Agentic Tasks
Explorar
Noticias de IA
37834 elementos — filtrados, clasificados y sin duplicados
FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use
Faster-WAM: Do World Action Models Need Deep Action Modules?
Can Urban Blight Be Accessed with Vision-language Models: A Case Study in Detroit
SPECTRA: Band-Routed Embedding and Stage-Wise LoRA for Cross-Sensor Fine-Tuning of Geospa…
Disagree to Accelerate: Closing the Loop on Diffusion Feature Forecasts
PAC Approximation and DIRECT Optimization for Parametric Markov Models
TIDES: A Longitudinal Bilingual Dataset for Modeling Multi-Party Social Dynamics
MNC: Scope-Bound Semantic Declassification for Private LLM-Agent Communication
Rethinking Generative AI Literacy: An Integrative, Developmental, and Dialectical Framewo…
Entity-Aware Sequence Transduction for Player-Centric Ball Action Spotting
ProtoAct: Turning Wet-Lab Protocols into Embodied Robotic Actions
Style Wins, Substance Loses: A Diagnosis of LLM-as-Judge in Idea Generation
Few-Shot Concept Prompt Learning for Segmentation Foundation Models via Visual Grounding
SyncPlan: Long-Horizon LLM Coordination with Explicit Synchronization and Adaptive Correc…
CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Mode…
AI-assisted Script Management for Requirements Elicitation Interviews
Group Selection as a Safeguard Against AI Substitution
QWRF-Net: A Quantum-Wavelet Framework with Rectified Flow for Short-Term Precipitation No…
Can You Trust the Confidence? ConfBench for Vision-Language Models on Document Extraction
Chess on Ice: Curling Tactical Decision-Making via Backward Induction and Deep Reinforcem…
Linear Multi-Timescale Retention as a Memory-Efficient Vision-Language Bridge
PICTURE: Enhancing Theory-of-Mind in Large Language Models by Revealing, Not Hiding, Char…
CraftAlign: Feature-Grounded Evaluation and Revision Guidance for AI Stories
The Label Defines the Timescale: Trait-State Limits of Temporal-Aggregate Learning
Measuring in-context algorithmic reasoning in language models against an exact Bayes-opti…
Rethinking Personalized Reward Modeling for LLMs under Preference Heterogeneity via Group…
Optimising for Flourishing: Flourishing Metrics and Return on Flourishing as Success Crit…
Cooperative Coevolution for Resource-Constrained Agentic LLM Post-Training
Response Magnitude as a Dominant Signal for Held-Out CRISPRi Perturbation Effect Predicti…