Explorar

Noticias de IA

21271 elementos — filtrados, clasificados y sin duplicados

arXiv cs.AI Research & Papers
Structured Agent Distillation for Large Language Model
arXiv cs.AI Research & Papers
Revealing Algorithmic Deductive Circuits for Logical Reasoning
arXiv cs.AI Research & Papers
When Context Flips, Safety Breaks: Diagnosing Brittle Safety in Aligned Language Models
arXiv cs.AI Research & Papers
Deepfake-Eval-2024: A Multi-Modal In-the-Wild Benchmark of Deepfakes Circulated in 2024
arXiv cs.AI Research & Papers
Persuade Me if You Can: A Framework for Evaluating Persuasion Effectiveness and Susceptib…
arXiv cs.AI Research & Papers
Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Moni…
arXiv cs.AI Research & Papers
Improving Requirements Classification with SMOTE-Tomek Preprocessing
arXiv cs.AI Research & Papers
AIBuildAI-2: A Knowledge-Enhanced Agent for Automatically Building AI Models
arXiv cs.AI Research & Papers
PortBench: A Correlation-Aware, Full-Pipeline Benchmark for LLM-Driven Portfolio Manageme…
arXiv cs.AI Research & Papers
SKILLC: Learning Autonomous Skill Internalization in LLM Agents via Contrastive Credit As…
arXiv cs.AI Research & Papers
Generalized Holographic Reduced Representations
arXiv cs.AI Research & Papers
Democratizing Large-Scale Re-Optimization with LLM-Guided Model Patches
arXiv cs.AI Research & Papers
Optimal LTLf Synthesis
arXiv cs.AI Research & Papers
Show, Don't TELL: Explainable AI-Generated Text Detection
arXiv cs.AI Research & Papers
Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows
arXiv cs.AI Research & Papers
Do Agents Think Deeper? A Mechanistic Investigation of Layer-Wise Dynamics in Sequential …
arXiv cs.AI Research & Papers
Geometry of Human Perceptual Domains Emerges Transiently in LLM Representations
arXiv cs.AI Research & Papers
AsyncTool: Evaluating the Asynchronous Function Calling Capability under Multi-Task Scena…
arXiv cs.AI Research & Papers
Confidence-Orchestrated Self-Evolution against Uncertain LLM Feedback
arXiv cs.AI Research & Papers
DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis
Hugging Face Daily Papers Research & Papers
Compute Allocation in Evolutionary Search: From Depth-Breadth to Multi-Armed Bandits
Hugging Face Daily Papers Research & Papers
Inferring the Size of Large Language Models From Popular Text Memorization
Marktechpost Research & Papers
Sakana AI Proposes DiffusionBlocks: a Block-wise Training Framework That Converts Residua…
Hugging Face Daily Papers Research & Papers
Slogans or Stance? A Label-Light Diagnostic for Entrepreneurial-Discourse Measurement on …
Hugging Face Daily Papers Research & Papers
GEO-Bench: Benchmarking Ranking Manipulation in Generative Engine Optimization
Hugging Face Daily Papers Research & Papers
Optimal Rates for Differentially Private Hypothesis Testing with E-values
Hugging Face Daily Papers Research & Papers
PEFT-Arena: Understanding Parameter-Efficient Finetuning from a Stability-Plasticity Pers…
Hugging Face Daily Papers Research & Papers
Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players
Hugging Face Daily Papers Research & Papers
Self-Improving Language Models with Bidirectional Evolutionary Search
Hugging Face Daily Papers Research & Papers
Beyond Binary: Sim-to-Real Dexterous Manipulation with Physics-Grounded Contact Represent…