Explorar

Noticias de IA

29348 elementos — filtrados, clasificados y sin duplicados

arXiv cs.AI Research & Papers
Unveiling the Structure of Do-Calculus Reasoning via Derivation Graphs
arXiv cs.AI Research & Papers
When to Re-Plan: Subgoal Persistence in Hierarchical Latent Reasoning
arXiv cs.AI Research & Papers
LAP: An Agent-to-Instrument Protocol for Autonomous Science
arXiv cs.AI Research & Papers
Reproducibility is the New Copyleft: Defining AGI-oriented Reproducible Builds
arXiv cs.AI Research & Papers
VistaHop: Benchmarking Multi-hop Visual Reasoning for Visual DeepSearch
arXiv cs.AI Research & Papers
From Answers to States: Verifiable Process-Level Evaluation of Chemical Reasoning in Larg…
arXiv cs.AI Research & Papers
The DeepSpeak-Agentic Dataset
arXiv cs.AI Research & Papers
CORE: Conflict-Oriented Reasoning for General Multimodal Manipulation Detection
arXiv cs.AI Research & Papers
From Prompt to Service: An SLM-Based Agent Orchestration Gateway for AI-Driven Virtual Wo…
arXiv cs.AI Research & Papers
DELTAMEM: Incremental Experience Memory for LLM Agents via Residual Trees
arXiv cs.AI Research & Papers
WISE-HAR: A Generalizable Ensemble Deep Learning Framework for WiFi-Based Human Activity …
arXiv cs.AI Research & Papers
PSViT: A Methodology for Structurally Pruning Spiking Vision Transformers
arXiv cs.AI Security & Safety
DDOR: Delta Debugging for Explainable Overrefusal Testing and Repair
arXiv cs.AI Research & Papers
BaltiVoice: A Speech Corpus and Fine-tuned Whisper ASR System for the Balti Language
arXiv cs.AI Security & Safety
A Hybrid Approach For Malware Classification Using Secondary Features Fusion
arXiv cs.AI Research & Papers
What Benchmarks Don't Measure: The Case for Evaluating Abstention Competence in Autonomou…
arXiv cs.AI Research & Papers
When RLHF Fails: A Mechanistic Taxonomy of Reward Hacking, Collapse, and Evaluator Gaming
arXiv cs.AI Research & Papers
BAHSD: Bridging the Long-tail Gap via Adaptive Distillation in Black-box Sequential Recom…
arXiv cs.AI Research & Papers
AI Rater Discrimination Depends on Scoring Protocol in Complex Clinical Decision-Making
arXiv cs.AI Research & Papers
Large AI Models in Dental Healthcare: From General-Purpose Systems to Domain-Specific Fou…
arXiv cs.AI Research & Papers
WebRISE: Requirement-Induced State Evaluation for MLLM-Generated Web Artifacts
arXiv cs.AI Research & Papers
AI-Generated Traces for Novice Programmers: Learning Effects and Learner Differences in a…
arXiv cs.AI Research & Papers
Don't Gamble, GAMBLe: An Analytical Framework for AI-Driven Research Systems
arXiv cs.AI Research & Papers
RobotValues: Evaluating Household Robots When Human Values Conflict
arXiv cs.AI Research & Papers
FLIPS: Instance-Fingerprinting for LLMs via Pseudo-random Sequences
arXiv cs.AI Research & Papers
Physics-Guided Policy Optimization with Self-Distillation
arXiv cs.AI Research & Papers
Safety Measurements for Fine-tuned LLMs Should be Grounded in Capability
arXiv cs.AI Research & Papers
Evaluating Transformer and LSTM Frameworks for Prediction in Ungauged Basins
arXiv cs.AI Research & Papers
ChatHealthAI: Aligning Electronic Health Record Representations with Large Language Model…
arXiv cs.AI Research & Papers
Solipsistic Superintelligence is Unlikely to be Cooperative