Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitr…
Explorar
Noticias de IA
30304 elementos — filtrados, clasificados y sin duplicados
Auto-JEPA: A Latent World Model of Continuous Intent for End-to-End Autonomous Driving
Improving scDiffusion with Sparsity-Biased Classifier-Free Guidance
AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimiz…
Learning Lookahead Lemmas for Neural Network Verification
ModelEquivBench: Certifying Multi-Relational Evaluation of LLM-Generated Optimization Mod…
The Formalism Trap: Are LLM-as-a-Judge Evaluators Blinded by Consensus Mimicry under Soci…
Federated Foundation Models Fine-Tuning with Heterogeneous Compressed Clients
Safety, or Just Capability? A Validity Audit of Agent-Safety Benchmarks
Looks Right, Works Right: A Project-Level Benchmark for Multi-Screen Mobile App Generation
Library Reachability in LSR-Synth: How Anti-Memorization Design Changes the Measurement o…
InferQ: A Database-Oriented Benchmark for Quantum Circuits Simulation
ConnectED: A Curriculum-Aligned AI System for Vietnamese Instructional Lesson Planning an…
Why It Hurts: Identifying the Drivers of Negative Thoughts in Emotional Support Conversat…
Have I Seen You? Embedding Behavior Signals Synthetic Face Dataset Membership
Maximum Entropy Behavior Exploration for Sim2Real Zero-Shot Reinforcement Learning
Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Aut…
How Hard Does It Think? Analyzing Step-Aware Reasoning Energy in LLM Chain-of-Thought Tra…
Generative AI in Action: Field Experimental Evidence from Alibaba's Customer Service Oper…
ActionParty: Multi-Subject Action Binding in Generative Video Games
An Ontology-Guided, Deduplication-Aware Extraction Layer for Knowledge Graph Construction…
Evaluating the Alignment Between GeoAI Explanations and Domain Knowledge in Satellite-Bas…
TimeRFT: Stimulating Generalizable Time Series Forecasting for TSFMs via Reinforcement Fi…
TAPR: Enhancing LLM Performance with a Task-Aware Prompt Rewriter
Predict-then-Diffuse: Adaptive Response Length for Compute-Budgeted Inference in Diffusio…
RePaCA: Leveraging Reasoning Large Language Models for Static Automated Patch Correctness…
Patch-Based 3D Variational Autoencoder for Super-Resolution of Turbulent Channel Flow
Detecting AI-Generated Videos with Spiking Neural Networks
DRIP-R: A Benchmark for Decision-Making and Reasoning Under Real-World Policy Ambiguity i…
CLIFT: Turning Gemini Robotics On-Device into Humanoid Specialists via Non-Invasive Close…