Local verification cannot detect non-transportability: a cohomological theory of context …
Explorar
Noticias de IA
29341 elementos — filtrados, clasificados y sin duplicados
Every pooling rule has its world: matching probability combination rules to situations an…
Symbolic Machine Learning for Vapor-Liquid Equilibrium Prediction in Cx-N2 Binary Mixtures
When the API Speaks the Wrong Language: Revisiting Post-Training for Multilingual Tool Use
Fingerprinting Text-to-Image Diffusion Models via Collapsed Generation
Can Frontier LLMs Match Natively Multimodal Embeddings? A Comparison on Hard-Negative Tex…
Better Slots, Better Worlds: Representation Quality & Robustness in Object-Centric World …
High-dimensional Multi-objective Bayesian Optimization with Learned Variable Interactions
From Numbers to Judgment: Specialist LLM Agents and Reinforcement Learning for European L…
CTBench: Evaluating Troubleshooting Capabilities of AI Agents in Realistic Telecom Networ…
REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation
The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance
Low-Interaction-Rank Learning: Unifying Multiplicative Dual-Encoder Heads
Consolidator: Learning Persistent Routed Memory Across Context Boundaries
Robust and Efficient Noisy-Label Time-Series Classification via Dynamic Time Warping Base…
When Self-Consistency Backfires: Majority Vote Hurts the Majority of Hard Science Problem…
BEST-KAG: Enhancing Question Answering of Building Engineering Standards with Multimodal …
Confidence Calibration of Deep Learning Systems
From Prompting to Behavioral Alignment: Personalized LLM Judges for Recommendation Evalua…
Hybrid-Policy Self-Editing for Composable Unstructured Knowledge Editing
Claim-Level Reliability Assessment for Efficient Test-Time Reasoning
Is Per-Agent Policy Composition Safe? Rethinking Successor-Feature Transfer in Cooperativ…
CoAdapt-GUI: Joint Workflow Context and Policy Adaptation for Unseen GUI Applications
Making AI-Generated Feedback Matter: From Provision to Student Enactment
VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies
Backdoor Decontamination Dynamics in LLM Agents
Dynamics Models for Offline Hyperparameter Selection in Real-World RL
From Monolithic to Modular: Segment-level Automatic Prompt Optimization
Distribird: Literature-Informed Prior Distribution Design for Bayesian Model Calibration
Who Thinks Best Depends on How Long You Let Them: Budget-Dependent Rankings in LLM Evalua…