Robust Code RL via Faulty-Code-Driven Test case Synthesis and Dense Reward Shaping
Explorar
Noticias de IA
37834 elementos — filtrados, clasificados y sin duplicados
Evaluating Multiple LLM Generations with Validated Task Coverage
Adaptive Influence Graphs for Failure Attribution in Multi-Agent Systems
Scalable Question-Centric Text-to-Image Evaluation: Reliable Ranking, Fine-Grained Diagno…
OmniJudge or OmniBias? Diagnosing Multimodal Judges through Balanced, Decoupled Lenses
Paritok-4B: Intent-Conditioned Context Compression for Coding Agents
SonarLLM: A Native Sonar--Optical Multimodal Large Language Model for Underwater Percepti…
ACE: A Self-Correcting Agentic Canvas Editor for Multi-Slide Presentation Automation
EMRB: A Multi-Level Benchmark for Evaluating LLM Reasoning over Raw Electromagnetic Signa…
A Human-Factors Guided Cognitive Model of Visuospatial Complexity in Embodied Active Visi…
Confidently Wrong, Silently So: Auditing Undetectable Failures of a Deployed On-Device La…
Fidelity Preference, Not Demographic Preference: A Pixel-Level Attribute-Sensitivity Audi…
Benchmarking LLM Judges for Voice-Agent Evaluation: Reliability, Calibration, and Human O…
From State to Action: OODA-Tool for Reliable Multi-Turn Tool Use
Method, Mind, and Morality: How People Make Sense of Artificial Intelligence
Feedback That Backfires: Why Small Language Model Agents Repeat the Call They Just Watche…
ToolRobustBench: Stage-Wise Perturbation Evaluation and Failure Diagnosis for Tool-Callin…
Ensemble of Convolutional Neural Networks for StrokePrediction: Towards Improved Diagnost…
ExPhy: A Benchmark for Explicit Physical Property Learning in Multi-Object Trajectory For…
Identifying Latent Declarative Representations of Code for Assisting Repository Migration
FedV-KGQA: Multi-Hop Question Answering over Vertically Partitioned Knowledge Graphs
CoMMa: Contribution-Aware Medical Multi-Agents for Decentralized Oncology Decision Support
When Less Is More: An Empirical Study of Minimal Responses in Counseling Dialogues and th…
ChorusTIC: Training-Free Multivariate Time Series Classification via Chorus In-Context Le…
Restoring Without Forgetting: Continual Learning Across Image Degradations
PARTAB: Partition-Aware Reasoning with Structured Evidence for Scalable Table Understandi…
StepGuard: Learning Step-Level Guardrails with Scalable Supervision and Safety-Utility Ba…
ESQ-Bench: A Multi-Tier Enterprise Oracle Benchmark for Evaluating NL2SQL Dialect General…
Robust Motion Generation using Part-level Reliable Data from Videos
CoWorld-VLA: Thinking in a Multi-Expert World Model for Autonomous Driving