MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations
Explorar
Noticias de IA
27413 elementos — filtrados, clasificados y sin duplicados
HenTwin: A Multimodal Digital Twin Framework for Longitudinal Biological State Monitoring…
MMShopBench: A Real-Log Benchmark for Multimodal, Multi-Turn Shopping Agents
Evidence-Grounded Constraint Checking in Construction Documents
COntExt: Towards Context-Aware Ontology Extension from Operational Metrics
On the Generalization of Steering Vectors for Chain-of-Thought Faithfulness
Harnessing the Wisdom of LLM Crowds through Complementarity-Driven Iterative Collaboration
Translation with Thought: Difficulty-Adaptive Reasoning via Reinforcement Learning for Mu…
AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimiz…
CLIFT: Turning Gemini Robotics On-Device into Humanoid Specialists via Non-Invasive Close…
Gated Q-learning: Add Off-Policy Bias to Taste
Information Processing by Neuron Populations in the Central Nervous System: A Theory of t…
MAGA: Multi-Platform Self-Fusion of GUI Agents via Structured Action Distillation
SREGym: A Live Benchmark for AI SRE Agents with High-Fidelity Failure Scenarios
FairFund-Bench: Evaluating Distributive Bias in LLM Resource Allocation
MOT-SR: Multi-Objective Tool-Augmented Scientific Equation Discovery with Large Language …
ModelEquivBench: Certifying Multi-Relational Evaluation of LLM-Generated Optimization Mod…
Reason-Mediated Behavioral Models for Auditing LLM Social Simulators
Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures
A Human-Centered Validation of the Explainability-Performance Coefficient
Latent Actions from Factorized Transition Effects under Agent Ambiguity
Fast Feature Field ($\text{F}^3$): A Predictive Representation of Events
DualityCert: Verifier-Gated Language-Model Repair of Broken Duality Claims in Quantum Fie…
Dual-Dimensional Consistency: Balancing Budget and Quality in Adaptive Inference-Time Sca…
DungeonBench: A Benchmark for Rules-Rich Tactical Reasoning in Dungeons & Dragons Combat
The Formalism Trap: Are LLM-as-a-Judge Evaluators Blinded by Consensus Mimicry under Soci…
LEX-EC: A Lexical Evidence-Channel Audit Framework for Zero-Shot LLM Personality Classifi…
ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction
Scaffolding Critical Engagement with GenAI: Transforming Ethnic Minority Preparatory Stud…
Topology-Aware Data Movement for Disaggregated GPU Inference