Explorar

Noticias de IA

29655 elementos — filtrados, clasificados y sin duplicados

arXiv cs.AI Research & Papers
Can Small Language Models Reliably Resist Jailbreak Attacks? A Comprehensive Evaluation
arXiv cs.AI Research & Papers
A Contractualist Argumentation Framework for Moral Decision-Making
arXiv cs.AI Research & Papers
Cost-Based Semantics for Querying Inconsistent Weighted Knowledge Bases
arXiv cs.AI Research & Papers
SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation
arXiv cs.AI Research & Papers
Shared Organizational Memory for Enterprise Coding Agents: System Design and Deployment S…
arXiv cs.AI Research & Papers
Unifying biomedical knowledge in a modern multimodal graph
arXiv cs.AI Research & Papers
HypEHR: Hyperbolic Modeling of Electronic Health Records for Efficient Question Answering
arXiv cs.AI Research & Papers
OntoTKGE: Ontology-Enhanced Temporal Knowledge Graph Extrapolation
arXiv cs.AI Research & Papers
High-Stakes Decisions with Language Models: Insights from Emergency Triage
arXiv cs.AI Research & Papers
GeoMind: An Agentic Workflow for Lithology Classification with Reasoned Tool Invocation
arXiv cs.AI Research & Papers
When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling
arXiv cs.AI Security & Safety
Minimal, Local, Causal Explanations for Jailbreak Success in Large Language Models
arXiv cs.AI Research & Papers
When Only the Final Text Survives: Implicit Execution Tracing for Multi-Agent Auditing
arXiv cs.AI Research & Papers
Group Selection as a Safeguard Against AI Substitution
arXiv cs.AI Research & Papers
FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use
arXiv cs.AI Research & Papers
CORE: Collaborative Reasoning via Cross Teaching
arXiv cs.AI Research & Papers
Mind the Sim2Real Gap in User Simulation for Agentic Tasks
arXiv cs.AI Research & Papers
TeachArena: Are Language Agents Ready for Realistic Teaching Work?
arXiv cs.AI Research & Papers
Unleashing the Potential of Large Language Models: A Blueprint for Real-Time, Enterprise-…
arXiv cs.AI Research & Papers
ICU-Bench:Benchmarking Continual Unlearning in Multimodal Large Language Models
arXiv cs.AI Research & Papers
Bounded Normative Equivalence in Human-AI Cooperation: Group Behaviour, Not Partner Label…
arXiv cs.AI Research & Papers
Trust or Check? Understanding the (Evolutionary) Dynamics of User Trust in AI Systems
arXiv cs.AI Research & Papers
LADY: Linear Attention for Autonomous Driving Efficiency without Transformers
arXiv cs.AI Research & Papers
SIEVE: Selective Integrity Verification and Escalation for Defending LLM Agents against I…
arXiv cs.AI Research & Papers
Panning for Gold: Expanding Domain-Specific Knowledge Graphs with General Knowledge
arXiv cs.AI Research & Papers
Knowledge Graph Augmented Large Language Models for Disease Prediction
arXiv cs.AI Research & Papers
AIC-VDS: Attention-Based In-Context Learning for Joint Velocity Control and Data Collecti…
arXiv cs.AI Research & Papers
Efficiency vs. Alignment: Investigating Safety and Fairness Risks in Parameter-Efficient …
arXiv cs.AI Research & Papers
ProbGuard: Proactive Runtime Monitoring for LLM Agent Safety via Probabilistic Prediction
arXiv cs.AI Research & Papers
DeepSurvey-Bench: Evaluating Academic Value of Automatically Generated Scientific Surveys