Explorar

Noticias de IA

27413 elementos — filtrados, clasificados y sin duplicados

arXiv cs.AI Research & Papers
MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations
arXiv cs.AI Research & Papers
HenTwin: A Multimodal Digital Twin Framework for Longitudinal Biological State Monitoring…
arXiv cs.AI Research & Papers
MMShopBench: A Real-Log Benchmark for Multimodal, Multi-Turn Shopping Agents
arXiv cs.AI Research & Papers
Evidence-Grounded Constraint Checking in Construction Documents
arXiv cs.AI Research & Papers
COntExt: Towards Context-Aware Ontology Extension from Operational Metrics
arXiv cs.AI Research & Papers
On the Generalization of Steering Vectors for Chain-of-Thought Faithfulness
arXiv cs.AI Research & Papers
Harnessing the Wisdom of LLM Crowds through Complementarity-Driven Iterative Collaboration
arXiv cs.AI Research & Papers
Translation with Thought: Difficulty-Adaptive Reasoning via Reinforcement Learning for Mu…
arXiv cs.AI Research & Papers
AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimiz…
arXiv cs.AI Research & Papers
CLIFT: Turning Gemini Robotics On-Device into Humanoid Specialists via Non-Invasive Close…
arXiv cs.AI Research & Papers
Gated Q-learning: Add Off-Policy Bias to Taste
arXiv cs.AI Research & Papers
Information Processing by Neuron Populations in the Central Nervous System: A Theory of t…
arXiv cs.AI Research & Papers
MAGA: Multi-Platform Self-Fusion of GUI Agents via Structured Action Distillation
arXiv cs.AI Research & Papers
SREGym: A Live Benchmark for AI SRE Agents with High-Fidelity Failure Scenarios
arXiv cs.AI Research & Papers
FairFund-Bench: Evaluating Distributive Bias in LLM Resource Allocation
arXiv cs.AI Research & Papers
MOT-SR: Multi-Objective Tool-Augmented Scientific Equation Discovery with Large Language …
arXiv cs.AI Research & Papers
ModelEquivBench: Certifying Multi-Relational Evaluation of LLM-Generated Optimization Mod…
arXiv cs.AI Research & Papers
Reason-Mediated Behavioral Models for Auditing LLM Social Simulators
arXiv cs.AI Research & Papers
Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures
arXiv cs.AI Research & Papers
A Human-Centered Validation of the Explainability-Performance Coefficient
arXiv cs.AI Research & Papers
Latent Actions from Factorized Transition Effects under Agent Ambiguity
arXiv cs.AI Research & Papers
Fast Feature Field ($\text{F}^3$): A Predictive Representation of Events
arXiv cs.AI Research & Papers
DualityCert: Verifier-Gated Language-Model Repair of Broken Duality Claims in Quantum Fie…
arXiv cs.AI Research & Papers
Dual-Dimensional Consistency: Balancing Budget and Quality in Adaptive Inference-Time Sca…
arXiv cs.AI Research & Papers
DungeonBench: A Benchmark for Rules-Rich Tactical Reasoning in Dungeons & Dragons Combat
arXiv cs.AI Research & Papers
The Formalism Trap: Are LLM-as-a-Judge Evaluators Blinded by Consensus Mimicry under Soci…
arXiv cs.AI Research & Papers
LEX-EC: A Lexical Evidence-Channel Audit Framework for Zero-Shot LLM Personality Classifi…
arXiv cs.AI Research & Papers
ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction
arXiv cs.AI Research & Papers
Scaffolding Critical Engagement with GenAI: Transforming Ethnic Minority Preparatory Stud…
arXiv cs.AI Research & Papers
Topology-Aware Data Movement for Disaggregated GPU Inference