MIRA: A Bilingual Benchmark for Medical Information Response Audit
Explorar
Noticias de IA
21271 elementos — filtrados, clasificados y sin duplicados
On the Fallacy of Global Token Perplexity in Spoken Language Model Evaluation
Learning Tangent Bundles and Characteristic Classes with Autoencoder Atlases
RelaxFlow: Text-Driven Amodal 3D Generation
Reasoning Matters: Mitigate Hallucination in Multimodal Large Reasoning Models via Reason…
Coherence Collapse: Diagnosing Why Code Agents Fail After Reaching the Right Code
Retention Consequence in Lifecycle Memory Control
Cultural Fidelity in English-to-Hindi Translation: A Preservation-Fluency Frontier for Ge…
The Grammar of Transformers: A Systematic Review of Interpretability Research on Syntacti…
From Talking to Singing: A New Challenge for Audio-Visual Deepfake Detection
Ligand-Conditioned Discrete Diffusion for Protein Sequence-Structure Co-Design
C-MORAL: Controllable Multi-Objective Molecular Optimization with Reinforcement Alignment…
CubePart: An Open-Vocabulary Part-Controllable 3D Generator
C-MIG: Multi-view Information Gain-based Retrieval-Augmented Generation for Clinical Diag…
Data-Efficient On-Policy Distillation for Automatic Speech Recognition
GraD-IBD: Graph Representation Learning from Diagnosis Trajectories for Early Detection o…
SkillGrad: Optimizing Agent Skills Like Gradient Descent
Hierarchical Prompt-Domain Control and Learning for Resource-Constrained Agentic Language…
You Are in Control of Your State: Why Human Outcomes Are Controllable Through Causal Stat…
Detecting and Mitigating the Correct-Answer Extinction Window in Test-Time Reinforcement …
The Forensic Cost of Watermark Removal: From Dedicated Attacks to Image Editing
Anatomy-Slot: Unsupervised Anatomical Factorization for Homologous Bilateral Reasoning in…
Voice "Cloning" is Style Transfer
Cyberbullying Governance on Social Media: A Unified Framework from Content Identification…
Teaching and Evaluating LLMs to Reason About Polymer Design Related Tasks
JMedEthicBench: A Multi-Turn Conversational Benchmark for Evaluating Medical Safety in Ja…
Object-Centric Vision Token Pruning for Vision Language Models
A Policy-Driven Runtime Layer for Agentic LLM Serving
Got a Secret? LLM Agents Can't Keep It: Evaluating Privacy in Multi-Agent Systems
Regression Language Models for Code