Explorar

Noticias de IA

37834 elementos — filtrados, clasificados y sin duplicados

arXiv cs.AI Research & Papers
FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Finan…
arXiv cs.AI Research & Papers
COMEX: A Composition-Grounded Benchmark and Learning Framework for Explainable Aesthetic …
arXiv cs.AI Research & Papers
How People Evaluate AI-, Expert-, and Peer-Style Financial Advice
arXiv cs.AI Research & Papers
DRBENCHER: Can Your Agent Identify the Entity, Retrieve Its Properties and Do the Math?
arXiv cs.AI Research & Papers
Geometry Beats Estimated Depth: RGB-Only Multi-Camera 3D Tracking under Sim2Real
arXiv cs.AI Research & Papers
SkillClaw: Let Skills Evolve Collectively with Agentic Evolver
arXiv cs.AI Research & Papers
MasDrift: Benchmarking Authorization Preservation Across Multi-Agent Architectures
arXiv cs.AI Research & Papers
Learning an Interior Layout Policy in a Domain Specific Language Action Space
arXiv cs.AI Research & Papers
Collaborative Multi-Agent Scripts Generation for Enhancing Imperfect-Information Reasonin…
arXiv cs.AI Research & Papers
ConMem: Contribution-Aware Memory for Long-Horizon Manufacturing Inspection Logs
arXiv cs.AI Research & Papers
Deep probabilistic logic programming for diagnostic reasoning from incomplete information…
arXiv cs.AI Research & Papers
MonitorBench: A Comprehensive Benchmark for Chain-of-Thought Monitorability in Large Lang…
arXiv cs.AI Research & Papers
A Comparative Study in Surgical AI: Potential and Limitations of Data, Compute, and Scali…
arXiv cs.AI Research & Papers
A foundation model of numerical intelligence with cross-disciplinary generalization
arXiv cs.AI Research & Papers
FreSH: Frequency-Segmented Hierarchical Multi-Expert Framework for Multivariate Time Seri…
arXiv cs.AI Research & Papers
VTO: Visual Tool Orchestration for Video Anomaly Detection
arXiv cs.AI Research & Papers
Privacy-Preserving Data Drift Detection and Recovery for Large-Scale LLM Applications via…
arXiv cs.AI Research & Papers
El Agente Gr\'afico: A Semantic Execution Runtime for Scientific Agents
arXiv cs.AI Research & Papers
MOSAIC: Adversarial Co-evolution of Specialist Heuristics and Problem Instances for LLM-b…
arXiv cs.AI Research & Papers
AutoRefine: Compiling Trajectories into Validated Typed Agent Artifacts
arXiv cs.AI Research & Papers
Targeted Counterfactual Fingerprinting for Black-Box LLM Ownership Verification
arXiv cs.AI Research & Papers
Biologically Informed Representation Learning for Robust Cross-Center Generalization of M…
arXiv cs.AI Research & Papers
$\texttt{DisMorph}$: learning to disentangle technical distortions from true biological c…
arXiv cs.AI Research & Papers
SPRInG: Continual LLM Personalization via Selective Parametric Adaptation and Retrieval-I…
arXiv cs.AI Research & Papers
Do Evaluation Metrics Detect Errors in Classical Chinese to English Translations?
arXiv cs.AI Research & Papers
SkillsMetric: Mapping the Detection Boundary of Static Analysis for Malicious Agent Skills
arXiv cs.AI Research & Papers
Agentic AI for Clustering, Relationship Discovery, and Semantic Trading in Prediction Mar…
arXiv cs.AI Research & Papers
IntelliAudit: Using Large Language Models to Evaluate Audit Controls
arXiv cs.AI Research & Papers
A Statistical Framework for Auditing Behavioral Dependence and Induced Bias in LLM Judges
arXiv cs.AI Research & Papers
Generalizing deep reinforcement learning across cable-driven parallel robot configuration…