Explorar

Noticias de IA

30675 elementos — filtrados, clasificados y sin duplicados

arXiv cs.AI Research & Papers
Is Deep Research Reliable? Misleading Knowledge Induces False Conclusions
arXiv cs.AI Security & Safety
Code Monitor Red Teaming for Public-Test-Passing Code
arXiv cs.AI Research & Papers
Auditing Evidence Use in Medical LLM Diagnosis
arXiv cs.AI Research & Papers
Efficient and Interpretable Body-Based Emotion Recognition with Lightweight Temporal Conv…
arXiv cs.AI Research & Papers
Enhancing Explainable Cardiac Diagnosis with Guide-Grounded Multimodal LLMs
arXiv cs.AI Research & Papers
Profiling Lightweight Large Language Models
arXiv cs.AI Research & Papers
Can an AI System Be Creative? A Critical Perspective from Art and Engineering
arXiv cs.AI Research & Papers
ArbiGraph: Arbitrarily Scalable Verifiable Task Graphs for Evaluating Context Management
arXiv cs.AI Research & Papers
NVIDIA-labs OO Agents: Native Python Object-Oriented Agents
arXiv cs.AI Research & Papers
AI-Driven Multi-Hop Relay Selection for Smart Urban NR-V2X Networks via Learning-to-Optim…
arXiv cs.AI Research & Papers
CMI-Mem: Toward Generalizable Long-Term Memory Management via CMI-Augmented Reinforcement…
arXiv cs.AI Research & Papers
StrideDiffusion: Accelerating Diffusion Models for Time-series Generation
arXiv cs.AI Research & Papers
AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use
arXiv cs.AI Research & Papers
DynamicMCPBench: A Trace-Grounded, Effect-Scored Benchmark for LLM Agents over Live MCP S…
arXiv cs.AI Research & Papers
ConfidenceBench: Evaluating Confidence Calibration in Large Language Models
arXiv cs.AI Research & Papers
Attention Degradation, Function Token Anchoring, and the Limits of Attention-Based Interv…
arXiv cs.AI Research & Papers
Representation Robustness Under Executable Reasoning Constraints in Large Language Models…
arXiv cs.AI Research & Papers
CANN Bench: Benchmarking Agent Generated Kernels against Real NPU and Algorithmic Limits
arXiv cs.AI Research & Papers
SiGMA: Sign-Guided Merging and Adaptation for Multimodal Continual Instruction Tuning
arXiv cs.AI Research & Papers
Telco-GAIA: Bilingual Benchmark for Agents in Telecom Domain
arXiv cs.AI Research & Papers
LeanFlow: A Case Study in Workflow-Driven Lean Autoformalization
arXiv cs.AI Research & Papers
MKEvolve: A Modular Multi-Agent Framework for Kernel Code Generation
arXiv cs.AI Research & Papers
FlowEdit: Information-Theoretic Control of LLM Reasoning Flows for Ill-posed Problems Inv…
arXiv cs.AI Research & Papers
ExecuGraph: A Multi-Agent, Execution-Grounded Framework for Reliable Backend Code Synthes…
arXiv cs.AI Research & Papers
AISE-Bench: A Full-Cycle Curated Benchmark for Information Seeking on Academic Knowledge …
arXiv cs.AI Research & Papers
From Errors to Rules: Iterative Prompt Optimization for Text Classification
arXiv cs.AI Research & Papers
Isolating LLM Alignment from Regex: Zero Coverage and Metric-Dependent Divergence Under A…
arXiv cs.AI Research & Papers
Attention-based Experience Replay Framework for Continual Learning of Agnostic Time Serie…
arXiv cs.AI Research & Papers
OPTScientist: Multi-Agent Discovery of Typed Optimizer Programs for Transformer Pretraini…
arXiv cs.AI Research & Papers
CRAWO: Custom Resources for Adaptive Workload Orchestration