Explorar

Noticias de IA

27413 elementos — filtrados, clasificados y sin duplicados

arXiv cs.AI Research & Papers
DRIFT: Difficulty Routing Self-DIstillation with Rhythm-Gated Exploration and Success BuF…
arXiv cs.AI Research & Papers
Cognitive World Model for Progressive BDI/E Trajectory Evaluation of Conversational Agents
arXiv cs.AI Research & Papers
MirrorCraft: Paired Evaluation under Hidden Rule Changes in Minecraft
arXiv cs.AI Research & Papers
LLM Framework for Discovering Major Mathematical Conjectures: AI's Quest for the Next Rie…
arXiv cs.AI Research & Papers
TAPR: Enhancing LLM Performance with a Task-Aware Prompt Rewriter
arXiv cs.AI Research & Papers
FBFM: A Training-Free Asynchronous Feedback Mechanism for Flow-Matching in World-Action M…
arXiv cs.AI Research & Papers
Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL
arXiv cs.AI Research & Papers
An Ontology-Guided, Deduplication-Aware Extraction Layer for Knowledge Graph Construction…
arXiv cs.AI Research & Papers
MOSAIC: Masked Outsourcing of Secure AI Computations
arXiv cs.AI Research & Papers
FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Lan…
arXiv cs.AI Research & Papers
DualDiT: A Conditional Dual-Output Diffusion Transformer for Joint OCT Image and Segmenta…
arXiv cs.AI Research & Papers
SAF-OPD: Stable Advantage Fusion for On-Policy Distillation
arXiv cs.AI Research & Papers
How Hard Does It Think? Analyzing Step-Aware Reasoning Energy in LLM Chain-of-Thought Tra…
arXiv cs.AI Research & Papers
Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Aut…
arXiv cs.AI Research & Papers
Library Reachability in LSR-Synth: How Anti-Memorization Design Changes the Measurement o…
arXiv cs.AI Research & Papers
Safety, or Just Capability? A Validity Audit of Agent-Safety Benchmarks
arXiv cs.AI Research & Papers
Creative Integration: A Decidable Criterion of Creativity
arXiv cs.AI Research & Papers
Between Suppression and Collapse: Evaluating Narrative Unlearning with LENS
arXiv cs.AI Research & Papers
Scaling Scientific Discovery Environments for Turn-Level Agentic RL
arXiv cs.AI Research & Papers
When Model Priors Conflict with Visual Evidence: Mitigating Commonsense-Driven Hallucinat…
arXiv cs.AI Research & Papers
What Makes a Sale? Simulating End-to-End Seller--Buyer Retail Dynamics with LLM Agents
arXiv cs.AI Research & Papers
Beyond Component Testing: Validating Agentic AI Systems
arXiv cs.AI Research & Papers
Can AI Evaluate AI Scientists? A Benchmarking Study of Autonomous Research Generation Sys…
arXiv cs.AI Research & Papers
DragonCrawl: A Generative, Intent-Based Framework for Scalable Mobile End-to-End Testing
arXiv cs.AI Research & Papers
A user's guide to PINNs in geometric analysis: lessons from the asymptotic Plateau problem
arXiv cs.AI Research & Papers
Best Friends, Not Forever: Evaluating Long-Horizon Persona Collapse and Behavioral Drift …
arXiv cs.AI Research & Papers
MBDiff: Multi-view Behavior-aware Diffusion Model for Probabilistic Utility Data Imputati…
arXiv cs.AI Research & Papers
ActFovea: Runtime Safeguarding for VLA Policies via Spatiotemporal Visual-Action Consiste…
arXiv cs.AI Research & Papers
Fragility of Value under Imperfect Alignment
arXiv cs.AI Research & Papers
NeSyFS: A Neuro-symbolic Fast-Slow Thinking Framework for LLM Agent under Partial Observa…