Explorar

Noticias de IA

37834 elementos — filtrados, clasificados y sin duplicados

arXiv cs.AI Research & Papers
SA-Bench: Evaluating Semantic Alignment in LLM-Based Paper Reproduction
arXiv cs.AI Research & Papers
TW-LegalBench: Measuring Taiwanese Legal Understanding
arXiv cs.AI Research & Papers
Preference Optimization for Non-Verbal Vocalization Synthesis
arXiv cs.AI Research & Papers
AgentRoom: Concurrent Multi-Agent Coding in a CRDT-Backed Shared Workspace
arXiv cs.AI Research & Papers
CoMMa: Contribution-Aware Medical Multi-Agents for Decentralized Oncology Decision Support
arXiv cs.AI Research & Papers
How much of a measured AI preference is the model, and how much is the instrument?
arXiv cs.AI Research & Papers
STAIN-FL: Stealthy Targeted Attack Injection with Contextual Triggers in Federated Learni…
arXiv cs.AI Research & Papers
More Rejective, Not More Discriminative: The Unit of Verification in Pre-Execution LLM Ov…
arXiv cs.AI Research & Papers
StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments
arXiv cs.AI Research & Papers
FLARE: A Systematic, Uncertainty-Aware Framework for Evidence-Based Adoption of Artificia…
arXiv cs.AI Research & Papers
Gated Activation Steering for Reducing Sycophancy & Hallucination in Medical Question Ans…
arXiv cs.AI Research & Papers
ICA: Information-Aware Credit Assignment for Visually Grounded Long-Horizon Information-S…
arXiv cs.AI Research & Papers
MolEmb: Multimodal Large Language Models Can Be Strong Molecular Embedding Models
arXiv cs.AI Research & Papers
On-policy Distillation with Verifiable Reward
arXiv cs.AI Research & Papers
PROOF-Gen: From Optimized Data to Better Distillation
arXiv cs.AI Research & Papers
Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment
arXiv cs.AI Research & Papers
AgentWorld: Personality-Aware Reliability Evaluation for Agentic Information Retrieval
arXiv cs.AI Research & Papers
LUCAID: Agentic Multimodal AI for Lung Cancer Precision Pathology
arXiv cs.AI Security & Safety
Names Can Hurt: Spotting Slopsquatting Risks Caused by Package Name Hallucinations in Loc…
arXiv cs.AI Research & Papers
Taming foundation model with invariance-oriented pre-training for broad-spectrum EEG anal…
arXiv cs.AI Research & Papers
AI Finds A Way
arXiv cs.AI Research & Papers
Fidelity Preference, Not Demographic Preference: A Pixel-Level Attribute-Sensitivity Audi…
arXiv cs.AI Research & Papers
The Handoff Tax: Continuing Non-Native Trajectories in LLM Agents
arXiv cs.AI Research & Papers
Efficient LLM Collaboration via Planning
arXiv cs.AI Research & Papers
VideoHarness-RSI: Recursive Harness Self-Improvement for Long-Video Understanding with Fr…
arXiv cs.AI Research & Papers
A tale of perfect fit and phantom optima: how data-driven models can fail in real-time op…
arXiv cs.AI Security & Safety
TrustShiftProbe: Characterizing, Benchmarking, and Defending Staged Trust Attacks on MCP …
arXiv cs.AI Research & Papers
Tlow: Flow-based Item Tokenizer for Recommendation
arXiv cs.AI Research & Papers
Memory Is Not Always Needed: Characterizing Conditional Memory in Scientific Reasoning
arXiv cs.AI Research & Papers
Beyond Accuracy: A Dual-Judge Evaluation Protocol for Vision-Language Models in Legally G…