Evaluating LLMs on Conversational Text-to-SQL under Chain Ambiguity and Intent Drift
Explorar
Noticias de IA
27413 elementos — filtrados, clasificados y sin duplicados
Autoregressive Mosaics: Probing 2D Spatial Reasoning in Text-Only Language Models
Personalized Group Relative Policy Optimization for Heterogenous Preference Alignment
CEDAR: Automata as Verifiable Interfaces for Language-Guided Embodied Action
Conformal Risk-Averse Decision Making with Optimized Certainty Equivalent Risk Control
VICT: Verifier-Instrumented Credit Tracing for Long-Horizon LLM Agent Reinforcement Learn…
Generative AI Expands the Intellectual Reach of Course Based Undergraduate Research Exper…
Understanding and Enforcing Weight Disentanglement in Task Arithmetic
If Agents Were Angels, No Governance Would Be Necessary: Out-of-Band Policy Enforcement a…
MathAdv: What Theorem Provers Know, Reason, Formalize, and Generalize
SpecMine: A Large-Scale Corpus of Spec-Driven Development Artifacts
Nemotron 3.5 Content Safety Moderator: A Compact Multimodal, Multilingual, and Reasoning …
Optimal Adversarial Testing: Extracting Honest Test Results from Dishonest Test Takers
A Framework for Object-Centric Predictive Monitoring of Collaborative Processes
Nested Byte-Level Vocabularies Are Cheap to Deploy and Expensive to Share: A Pre-Register…
ARC-CT: Anatomy-Routed Contrastive Vision-Language Learning for 3D Chest CT
LongPIBench: A Long-Context Benchmark for Prompt Injection
PAPO: Stabilizing Rubric Integration Training via Decoupled Advantage Normalization
An Enclosed Mode Is a Gauge Choice: Topology Relative to Reach in Certified Code World Mo…
Learning a Size-Weight Frontier for Synthetic-Augmented Inference
Rethinking Vacuity for OOD Detection in Evidential Deep Learning
TraceML: An Empirical Analysis of Human-Agent Planning in Machine Learning Development
AcCoRD: Evaluating User-Agent Collaboration Under Realistic User Preference Dynamics
A Probabilistic Interpretation of KV Cache Eviction
PanelShield: Verifiable Closed-Loop Safe Planning for Robotic Industrial Panel Operation
MaCoPlanner: LLM-Assisted Manual-Compiled Task Planning with Proactive Safety Verificatio…
Twin Worlds: Equivariance-Based Abstention for Evidence-Grounded Reasoning
Spatial-Semantic Reasoning using Large Language Models for Efficient UAV Search Operations
A Method for Layer Bit-Width Allocation in LLM Quantization via Performance Maximization …
Performative Privacy: When Differential Privacy Maximizes Utility