Can LLMs Time Travel? Enhancing Temporal Consistency in Legal Agentic Search through Rein…
Explorar
Noticias de IA
27413 elementos — filtrados, clasificados y sin duplicados
AI-Assisted Systematization for Evaluating GenAI Systems
TIAR: Trajectory-Informed Advantage Reweighting for LLM Abstention Learning
Learning to Reason Efficiently with A* Post-Training
When Search Becomes Memory: Turning Robot Design Trials into Transferable Skills
Clarify, Abstain or Answer? Strategising in Conversation with Belief-Augmented Generation
Fine-Tuning Over Architectural Complexity: Broad-Coverage PII Detection on PIIBench with …
Parameter-Efficient VLMs for Gastrointestinal Endoscopy: Medical Image Generation and Cli…
Beyond Inference-Only Deployment: Comparing Weight-Based Consolidation Against Cascading …
MDGMIX: Boundary-Aware Subgraph Mixing for Multi-Domain Graph Pre-Training
Exploration of Perceptual Speech Features for Clinical Decision-Support in Mental Health …
Certified Robustness from Approximate Gaussian Mixture Structures in Pretrained Latent Sp…
Proper Scoring Rules for Agentic Uncertainty Quantification
Uncertainty Decomposition via Cyclical SG-MCMC and Soft-label Learning for Subjective NLP
CoRe-Code: Collaborative Reinforcement Learning for Code Generation
PANDO: Efficient Multimodal AI Agents via Online Skill Distillation
Test-Time Deep Thinking to Explore Implicit Rules
WorldGUI: An Interactive Benchmark for Desktop GUI Automation from Any Starting Point
Conditional KRR: Injecting Unpenalized Features into Kernel Methods with Applications to …
CausaLab: A Scalable Environment for Interactive Causal Discovery Toward AI Scientists
StakeBench: Evaluating Language Understanding Grounded in Market Commitment
When Gradients Collide: Failure Modes of Multi-Objective Prompt Optimization for LLM Judg…
CITYREP: A Unified Benchmark for Urban Representations Across Cities, Tasks, and Modaliti…
Aes3D: Aesthetic Assessment in 3D Gaussian Splatting
Efficient Preference Poisoning Attack on Offline RLHF
Leveraging Spreading Activation for Improved Document Retrieval in Knowledge-Graph-Based …
VeriTrace: Evolving Mental Models for Deep Research Agents
Chain-of-Thought Hijacking
Claw-Anything: Benchmarking Always-On Personal Assistants with Broader Access to User's D…
Optimizing Sensor Placement for Flow Reconstruction in Urban Drainage Networks: A Digital…