Unequal Verdicts: Investigating Gender Bias in LLM-Based Fake News Detection
Explorar
Noticias de IA
21272 elementos — filtrados, clasificados y sin duplicados
CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dy…
Rethinking Self-Evolving Agent Skills: Feedback Dynamics over Multiple Rounds
Screenshots or Tools? Eliciting Tool Use and Managing Multimodal Context in Hybrid GUI-MC…
Uncovering Spontaneous Physics Representations in In-Context Learning
Lightweight Chunk Selection for Mobile Retrieval-Augmented Generation
Distilled Roads: Generalisable Road Network Extraction Across Sensors, Resolutions, and R…
PACE: Adaptive Budget Allocation for Time-Efficient Embodied Planning
Cross-Layer Interaction under Weight-Space Ablation: A Closed-Form Attention Jacobian Bou…
CARE-Bench: Benchmarking Patient-Facing LLM Triage
When Outputs Disperse, Does Epistemic Revision Follow? A Black-Box Diagnostic for Machine…
Optimal Liability Design for Medical AI
Rectify Then Diffuse: Disentangling Concepts Before Denoising Trajectory Unfolds
VeriTrace: Human-Like Temporal Exploration Completes Agentic Action Space
Neurosymbolic Reasoning with Incremental Knowledge for Sample Efficient Hierarchical Rein…
Interpreting Black-Box Large Language Models with Sentence-Level Energy Landscapes
From Social Coding to Agentic Coding: Productivity and Relational Reconfiguration in Open…
FOUND-AF: Benchmarking ECG Foundation Models for Atrial Fibrillation Detection
Instruction Stacking Collapse: A Benchmark and the Capability-Dependent Value of Prompt C…
Rethinking Modality Reliability in Multimodal Sentiment Analysis with Incomplete Observat…
BODHI: Do LLMs Branch Out and Discover Heterogeneous Inferences?
Adversarial Fast-Moving Real-World Domains as Test Beds for Benchmarking AI Scientist Cap…
FraQ: Efficient Coordinate-Space Recompression for Federated Low-Rank Adaptation
Enhancing Tabular Learners with Context-Aware Semantic Embeddings
Formal Verification of Agentic Systems over Operational Data
When Should Graph Attention Be Sparse? Learning a Per-Edge Tsallis Index
A Hierarchical Approach to Imitation Learning for Manipulation Tasks Requiring Time Varyi…
WeClawArena: An Auditable Sandbox and Benchmark for Cross-User Agents Collaboration and S…
ToolLIFT: Lifting Tool-Specific Trajectories into Function-Level Graphs for Generalizable…
Can LLM design high-quality experiments? A Comprehensive and Systematic Benchmark on Auto…