Explorar

Noticias de IA

37834 elementos — filtrados, clasificados y sin duplicados

arXiv cs.AI Research & Papers
Calibrated Enough to Know, Not Calibrated to Act: Fabricated Evidence Makes LLM Agents Co…
arXiv cs.AI Research & Papers
How Do LLM Agents Actually Get the Flag? Trace-Level Provenance for Agentic Offensive Sec…
arXiv cs.AI Research & Papers
FaithSieve: Fine-Grained Evaluation of Math Proofs with Faithful Formal Evidence
arXiv cs.AI Research & Papers
Discovering Relationships in Data Lakes Using Large Language Models: An Industrial Case
arXiv cs.AI Research & Papers
NeuronFuzz: Safety Neuron Guided Fuzzing for LLM Safety Evaluation
arXiv cs.AI Research & Papers
GROUND: Reducing Hallucinations in LLM-Based Enterprise Analytics Through Governed Semant…
arXiv cs.AI Research & Papers
Knowledge Cards: Structured Knowledge for AI Systems
arXiv cs.AI Research & Papers
Relational Over-Regularization: Graph-Based AI-Generated Text Detection via Sentence Tran…
arXiv cs.AI Research & Papers
Five Primitives for Governing Autonomous AI Agents at Runtime
arXiv cs.AI Research & Papers
Reinforcement Learning-Based Control of CAV Platoon Joining Maneuvers in Mixed Traffic
arXiv cs.AI Research & Papers
Recurrence Meets Transformers for Universal Multimodal Retrieval
arXiv cs.AI Research & Papers
PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents
arXiv cs.AI Research & Papers
Accelerating Scientific Research with Gemini in the Real-World
arXiv cs.AI Research & Papers
Active Diffusion-Based Inference for Ill-Posed Inverse Problems under Incomplete Priors
arXiv cs.AI Research & Papers
Style as a Confound: False Positives in AI Detection of Non-Native Academic Writing
arXiv cs.AI Research & Papers
Leveraging Large Language Models for Systematic Literature Review of Disease Spread Models
arXiv cs.AI Research & Papers
Don't Overthink, Don't Underthink: Toward Adaptive Reasoning in Agentic AI
arXiv cs.AI Research & Papers
Assessing mentalization in humans and large language models
arXiv cs.AI Research & Papers
MedFG-VQA: Low-Frequency Memory and Graph Attention for Lightweight Medical VQA
arXiv cs.AI Research & Papers
AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-C…
arXiv cs.AI Research & Papers
Agent Mesh: Reliability Primitives for Non-Idempotent Agent Delegation - Identity Adequac…
arXiv cs.AI Research & Papers
Same Model, Different Harness: Different Coding-Agent Results
arXiv cs.AI Research & Papers
LLM Agents for Time-Series: A Survey
arXiv cs.AI Research & Papers
AffectOmni: RL-Verifiable People-Centric Grounded Affective Reasoning for Social and Art-…
arXiv cs.AI Research & Papers
Predicting Consequences and Reinforcing Navigation Policies with Latent World Models
arXiv cs.AI Research & Papers
Invocation-Level Reliability of Tool-Using Agents
arXiv cs.AI Research & Papers
Multi2AV-Safety: Benchmarking Safety in Multimodal-to-Audio-Video Generation
arXiv cs.AI Research & Papers
Benchmarking AI Agents for Hardware Design Automation via MCP Tool Calling
arXiv cs.AI Research & Papers
Why did My Robot Just Change Personality? Prompting Guidelines for a Grounded Robot Perso…
arXiv cs.AI Research & Papers
TutorTrace: A Dataset and Taxonomy for Classifying Learner Behavioral States during AI-As…