SA-Bench: Evaluating Semantic Alignment in LLM-Based Paper Reproduction
Explorar
Noticias de IA
37834 elementos — filtrados, clasificados y sin duplicados
TW-LegalBench: Measuring Taiwanese Legal Understanding
Preference Optimization for Non-Verbal Vocalization Synthesis
AgentRoom: Concurrent Multi-Agent Coding in a CRDT-Backed Shared Workspace
CoMMa: Contribution-Aware Medical Multi-Agents for Decentralized Oncology Decision Support
How much of a measured AI preference is the model, and how much is the instrument?
STAIN-FL: Stealthy Targeted Attack Injection with Contextual Triggers in Federated Learni…
More Rejective, Not More Discriminative: The Unit of Verification in Pre-Execution LLM Ov…
StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments
FLARE: A Systematic, Uncertainty-Aware Framework for Evidence-Based Adoption of Artificia…
Gated Activation Steering for Reducing Sycophancy & Hallucination in Medical Question Ans…
ICA: Information-Aware Credit Assignment for Visually Grounded Long-Horizon Information-S…
MolEmb: Multimodal Large Language Models Can Be Strong Molecular Embedding Models
On-policy Distillation with Verifiable Reward
PROOF-Gen: From Optimized Data to Better Distillation
Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment
AgentWorld: Personality-Aware Reliability Evaluation for Agentic Information Retrieval
LUCAID: Agentic Multimodal AI for Lung Cancer Precision Pathology
Names Can Hurt: Spotting Slopsquatting Risks Caused by Package Name Hallucinations in Loc…
Taming foundation model with invariance-oriented pre-training for broad-spectrum EEG anal…
AI Finds A Way
Fidelity Preference, Not Demographic Preference: A Pixel-Level Attribute-Sensitivity Audi…
The Handoff Tax: Continuing Non-Native Trajectories in LLM Agents
Efficient LLM Collaboration via Planning
VideoHarness-RSI: Recursive Harness Self-Improvement for Long-Video Understanding with Fr…
A tale of perfect fit and phantom optima: how data-driven models can fail in real-time op…
TrustShiftProbe: Characterizing, Benchmarking, and Defending Staged Trust Attacks on MCP …
Tlow: Flow-based Item Tokenizer for Recommendation
Memory Is Not Always Needed: Characterizing Conditional Memory in Scientific Reasoning
Beyond Accuracy: A Dual-Judge Evaluation Protocol for Vision-Language Models in Legally G…