Explorar

Noticias de IA

30308 elementos — filtrados, clasificados y sin duplicados

arXiv cs.AI Research & Papers
Voluntary Collusion with Secret Tools in Competing LLM Agents
arXiv cs.AI Research & Papers
When prompt perturbations break your A/B test: A valid statistical test for generative su…
arXiv cs.AI Research & Papers
LaneRoPE: Positional Encoding for Collaborative Parallel Reasoning and Generation
arXiv cs.AI Models & Releases
Soro: A Lightweight Foundation Model and Chatbot for Tajik
arXiv cs.AI Research & Papers
Prompt Optimization Is a Coin Flip: Diagnosing When It Helps in Compound AI Systems
arXiv cs.AI Research & Papers
SkillSafetyBench: Evaluating Agent Safety under Skill-Facing Attack Surfaces
arXiv cs.AI Research & Papers
BIRDS: Characterizing and Understanding Biodiversity Impact of Large Language Model Servi…
arXiv cs.AI Research & Papers
Detect by Yourself: Self-Designing Agentic Workflows for Few-Shot Graph Anomaly Detection
arXiv cs.AI Research & Papers
DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis
arXiv cs.AI Research & Papers
Optimal LTLf Synthesis
arXiv cs.AI Research & Papers
Democratizing Large-Scale Re-Optimization with LLM-Guided Model Patches
arXiv cs.AI Research & Papers
Generalized Holographic Reduced Representations
arXiv cs.AI Research & Papers
Improving Requirements Classification with SMOTE-Tomek Preprocessing
arXiv cs.AI Research & Papers
Voice "Cloning" is Style Transfer
arXiv cs.AI Research & Papers
Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Moni…
arXiv cs.AI Research & Papers
Persuade Me if You Can: A Framework for Evaluating Persuasion Effectiveness and Susceptib…
arXiv cs.AI Research & Papers
Deepfake-Eval-2024: A Multi-Modal In-the-Wild Benchmark of Deepfakes Circulated in 2024
arXiv cs.AI Research & Papers
Structured Agent Distillation for Large Language Model
arXiv cs.AI Research & Papers
Regression Language Models for Code
arXiv cs.AI Research & Papers
Object-Centric Vision Token Pruning for Vision Language Models
arXiv cs.AI Research & Papers
Detecting and Mitigating the Correct-Answer Extinction Window in Test-Time Reinforcement …
arXiv cs.AI Research & Papers
JMedEthicBench: A Multi-Turn Conversational Benchmark for Evaluating Medical Safety in Ja…
arXiv cs.AI Research & Papers
Teaching and Evaluating LLMs to Reason About Polymer Design Related Tasks
arXiv cs.AI Research & Papers
You Are in Control of Your State: Why Human Outcomes Are Controllable Through Causal Stat…
arXiv cs.AI Research & Papers
Hierarchical Prompt-Domain Control and Learning for Resource-Constrained Agentic Language…
arXiv cs.AI Research & Papers
The Grammar of Transformers: A Systematic Review of Interpretability Research on Syntacti…
arXiv cs.AI Research & Papers
A Sheaf-Theoretic and Topological Perspective on Complex Network Modeling and Attention M…
arXiv cs.AI Research & Papers
SkillGrad: Optimizing Agent Skills Like Gradient Descent
arXiv cs.AI Research & Papers
ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning
arXiv cs.AI Research & Papers
Capture Timing-Attention of Events in Clinical Time Series