Signal or Spurious Cue? A Randomized Audit of Survey-Country Metadata in LLM Social Infer…
Explorar
Noticias de IA
37834 elementos — filtrados, clasificados y sin duplicados
Evaluating Investment Logic in Large Language Models: A Real-World Benchmark Towards Pers…
Temporal Bridges for Spatial Resolution: Enhancing Climate Data Super-Resolution with Bid…
Woodpecker Distillation: Weak Models Diagnose Reasoning Bugs in Strong Models
What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implication…
Depth-Guided Video Object Counting in Crowded Scenes
From Continuous Predictors to Clinical Thresholds: Early Evidence on Performance Trade-of…
Invariant Representation Learning for Source-Free Time Series Forecasting with LLM-Centri…
Abstract Event Causal Rules: Induction and Application
SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search Agents
Innocent Panels, Hateful Stories: Evaluating and Detecting Hateful Intent in Multi-Turn V…
PD-GS: Phoneme-Driven 3DGS for Audio-Driven Talking Heads
When Privileged Guidance Misaligns: State-Matched Routing and Contextualized Self-Distill…
Small Foundation Models of Human Cognition and Behaviour
Project2Task: Graph-Guided Project-Level Planning for Autonomous Research
Bias Analysis of L2 Speaking Assessment Systems Using Concept Activation Vectors
Tracing the Heart: An Evidence-Linked Pipeline for Heart-Failure Feature Engineering
HoloCount: A Holistic Visual Counting Benchmark for MLLMs
Quality Diversity for Reliable Data Driven Time-Use Optimization
Shaping Human-AI Interactions to Provide Improvement Pathways and Balance Competing Objec…
RA-CAD: Learning Post-Execution Critique for State-Aware Text-to-CAD Generation
TriQua: Reconciling Granularity and Context in Factuality Evaluation
BlockPython: A Process-Aware Agent-Supported Platform for the Transition from Block-Based…
Subliminal Learning is Non-Semantic Distillation
When Do Prompt-Side Agent Playbooks Transfer? Accuracy, Cost, and Runtime Shift in Agent …
ChainClaw: A Layered Agent Framework for Reliable On-Chain Execution
SkillMOO: Multi-Objective Optimization of Agent Skills for Software Engineering
ECHO: A Locally-Deployable Agentic Health Assistant with Temporal Memory, Safety Guardrai…
ViSR-KGC: Visual Subgraph Reasoning with Vision-Language Models for Multimodal Knowledge …
Seeing Is Not Deciding: Can Multimodal LLMs Act as Effective CEOs?