Explorar

Noticias de IA

27413 elementos — filtrados, clasificados y sin duplicados

arXiv cs.AI Research & Papers
Analytic Bridge Diffusions for Controlled Path Generation
arXiv cs.AI Research & Papers
Making Gaussian Kolmogorov-Arnold Networks Reliable and Accurate
arXiv cs.AI Research & Papers
Graph-Structured Rubrics: Compiling Rubrics into Typed Evaluation Graphs for LLM Judges
arXiv cs.AI Research & Papers
CTBench: Evaluating Troubleshooting Capabilities of AI Agents in Realistic Telecom Networ…
arXiv cs.AI Research & Papers
Claim-Level Reliability Assessment for Efficient Test-Time Reasoning
arXiv cs.AI Research & Papers
Constructing Dynamic Master Logic Models as Knowledge Graphs for Complex System Diagnosti…
arXiv cs.AI Research & Papers
VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies
arXiv cs.AI Research & Papers
An Agentic Workflow for Legacy HPC Modernization: Converting the Two-Electron-Integral Co…
arXiv cs.AI Research & Papers
Retrofitting Recurrent Depth into a Pretrained Language Model: Installation, Extrapolatio…
arXiv cs.AI Research & Papers
Backtrader-Bench: Benchmarking LLM Agents on Algorithmic Trading with Self-Generated MCQs
arXiv cs.AI Research & Papers
Reinforcement Learning based DBMS Buffer Pool Auto-Tuning for Optimal Memory Utilization
arXiv cs.AI Research & Papers
Proportional Analogies on Probability Distributions via Bayesian Updating
arXiv cs.AI Research & Papers
Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait…
arXiv cs.AI Research & Papers
OEIS Open: How many conjectures can language models turn into theorems?
arXiv cs.AI Research & Papers
Policy-as-logic for robust reasoning over rules
arXiv cs.AI Research & Papers
Agent Skills Can Be Harmful: An Empirical Study of Skill-Induced Failures in LLM Agents
arXiv cs.AI Research & Papers
Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence
arXiv cs.AI Research & Papers
Instruction Alignment for Binary Code Representation Learning
arXiv cs.AI Research & Papers
TEMPER: Testing Emotional Perturbation in Quantitative Reasoning
arXiv cs.AI Research & Papers
GRPO for Financial Advice Generation: Outperforming Commercial LLMs under CATE Evaluation
arXiv cs.AI Research & Papers
TELLME: Test-Enhanced Learning for Language Model Enrichment
arXiv cs.AI Research & Papers
Toward Meaningful Transparency for AI Chatbots: Disclosing Persuasive Intent Reduces Pers…
arXiv cs.AI Research & Papers
How China-Origin Vision-Language Models Move from Refusal to Reframing in State Alignment
arXiv cs.AI Research & Papers
LookBack: Where and How to Score LVLM Responses via Visual Reference Usage
arXiv cs.AI Research & Papers
CoQui: A Coordinate-Conditioned Quantum Implicit Generative Adversarial Network for End-t…
arXiv cs.AI Research & Papers
Benchmark-Based Comparative Assessment of Publicly Benchmarked Indian Foundation Models: …
arXiv cs.AI Research & Papers
Hamilton-Zero: A Neural Tensor-Network Foundation Model for Ground States of Arbitrary Qu…
arXiv cs.AI Research & Papers
TailBooster: A Dual-Layer Generative Framework for Extreme Value Augmentation with Operat…
arXiv cs.AI Research & Papers
Causal inference for group-contaminated structured outcomes: observable quotients, lossle…
arXiv cs.AI Research & Papers
LoongReflect: Boosting Long-Horizon Reflection in Search Agents via Global Perspective Di…