Evaluating LLM Trade-offs for Enterprise Automation: Lessons from Workflow Generation in …
Explorar
Noticias de IA
21861 elementos — filtrados, clasificados y sin duplicados
Fail-Fast, Restart-Smart: Early Failure Prediction and Restart for SWE Agentic Tasks
From Wearable Data to Personalized and Actionable Health Insights
GUI-Lens: Coarse-to-Fine Cropping for GUI Grounding with General-Purpose VLMs
Self-Supervised Representation-Guided Generative Dataset Distillation
FinVerse: Financial Time-Series Benchmark
Balancing Efficiency and Efficacy: Training-Free Attention-Guided Switching Between Expli…
Reversing Arrows in Large Language Models
Behaviorally Adaptive Visual Diversion for Inclusive and Resilient Digital Assessment Del…
CT-HEG: A Bidirectional, Timestamp-Attributed Event Graph for ICU In-Hospital Mortality P…
Can LLM design high-quality experiments? A Comprehensive and Systematic Benchmark on Auto…
DocTrace: Towards Traceable Long Document VQA via Hierarchical Evidence Graph Reasoning
Speculative Correction: Draft-then-Refine Decoding for Diffusion Language Models
AgentPanel: Toward a New Paradigm for Human--AI Collaboration in Exploring Scientific Que…
Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models
TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning
From Social Coding to Agentic Coding: Productivity and Relational Reconfiguration in Open…
Soft Guidance Starts to Outperform CoT Prompting as LLMs Improve
Failure-Informed Image Self-Augmentation for Multimodal Large Language Model Self-Improve…
MemArena: An Ego-Centric Benchmark for On-Device Agentic Personal Memory Assistants at Sc…
AgenticECO: An Agentic Framework for ECO on 3D Integrated Circuits
When Efficiency Becomes Fragility: Exploiting Dynamic Routing Vulnerabilities in Adaptive…
OncoTriad-QA: A Patient-Level Radiology-Pathology-Genomics Benchmark for Pan-Cancer Reaso…
Verifier-Guided Model Discovery for Physical Dynamical Systems with Pretrained Symbolic T…
The Ignition Is Real, and It Lives at the Readout: Latent composition, difficulty-clocked…
Social Pressure Breaks Majority Voting in LLM Safety Panels
muSync-GS: Physics-Synchronized Driving Video Synthesis for Weather and Geometric Road Ha…
Training-Free Hashing-Based Attention via Binary Principal Components
Elbow-Based MoE Routing: A Training-Free Inference Time Plugin for Expert Selection
NOLLI: A Difficulty-Calibrated Puzzle Benchmark for Diagnosing the English-Korean Perform…