Is Deep Research Reliable? Misleading Knowledge Induces False Conclusions
Explorar
Noticias de IA
30675 elementos — filtrados, clasificados y sin duplicados
Code Monitor Red Teaming for Public-Test-Passing Code
Auditing Evidence Use in Medical LLM Diagnosis
Efficient and Interpretable Body-Based Emotion Recognition with Lightweight Temporal Conv…
Enhancing Explainable Cardiac Diagnosis with Guide-Grounded Multimodal LLMs
Profiling Lightweight Large Language Models
Can an AI System Be Creative? A Critical Perspective from Art and Engineering
ArbiGraph: Arbitrarily Scalable Verifiable Task Graphs for Evaluating Context Management
NVIDIA-labs OO Agents: Native Python Object-Oriented Agents
AI-Driven Multi-Hop Relay Selection for Smart Urban NR-V2X Networks via Learning-to-Optim…
CMI-Mem: Toward Generalizable Long-Term Memory Management via CMI-Augmented Reinforcement…
StrideDiffusion: Accelerating Diffusion Models for Time-series Generation
AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use
DynamicMCPBench: A Trace-Grounded, Effect-Scored Benchmark for LLM Agents over Live MCP S…
ConfidenceBench: Evaluating Confidence Calibration in Large Language Models
Attention Degradation, Function Token Anchoring, and the Limits of Attention-Based Interv…
Representation Robustness Under Executable Reasoning Constraints in Large Language Models…
CANN Bench: Benchmarking Agent Generated Kernels against Real NPU and Algorithmic Limits
SiGMA: Sign-Guided Merging and Adaptation for Multimodal Continual Instruction Tuning
Telco-GAIA: Bilingual Benchmark for Agents in Telecom Domain
LeanFlow: A Case Study in Workflow-Driven Lean Autoformalization
MKEvolve: A Modular Multi-Agent Framework for Kernel Code Generation
FlowEdit: Information-Theoretic Control of LLM Reasoning Flows for Ill-posed Problems Inv…
ExecuGraph: A Multi-Agent, Execution-Grounded Framework for Reliable Backend Code Synthes…
AISE-Bench: A Full-Cycle Curated Benchmark for Information Seeking on Academic Knowledge …
From Errors to Rules: Iterative Prompt Optimization for Text Classification
Isolating LLM Alignment from Regex: Zero Coverage and Metric-Dependent Divergence Under A…
Attention-based Experience Replay Framework for Continual Learning of Agnostic Time Serie…
OPTScientist: Multi-Agent Discovery of Typed Optimizer Programs for Transformer Pretraini…
CRAWO: Custom Resources for Adaptive Workload Orchestration