DRBENCHER: Can Your Agent Identify the Entity, Retrieve Its Properties and Do the Math?
Explorar
Noticias de IA
37834 elementos — filtrados, clasificados y sin duplicados
FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Finan…
ConMem: Contribution-Aware Memory for Long-Horizon Manufacturing Inspection Logs
Do Evaluation Metrics Detect Errors in Classical Chinese to English Translations?
Frequency-Domain Dual-Branch Fusion for Medical Visual Question Answering
SkillClaw: Let Skills Evolve Collectively with Agentic Evolver
Scaling Inherently Interpretable Language Models
A Statistical Framework for Auditing Behavioral Dependence and Induced Bias in LLM Judges
A foundation model of numerical intelligence with cross-disciplinary generalization
The Capability Ladder: A Curriculum-Modernization Framework for Workforce Readiness in th…
Towards Researcher Agents for Knowledge-Graph Question Answering
Neurosymbolic Discovery of Algebraic Graph Constructions
TongGuOCR: A Layout-Aware and Token-Augmented OCR Framework for Chinese Historical Docume…
MonitorBench: A Comprehensive Benchmark for Chain-of-Thought Monitorability in Large Lang…
A Comparative Study in Surgical AI: Potential and Limitations of Data, Compute, and Scali…
Constraining ontology mappings using metaphysical choices
Dynamic Coalition Formation and Communication Pricing in Skill-Based Agentic AI Systems
Beyond Static Models: An Evolving Framework for Continual Learning in Large Language Mode…
MoRSE: Task-Oriented Multi-Agent System with Mixture of Role-Subtask Experts
DistillCache: KL-Guided Adaptive KV-Cache Eviction for Memory-Efficient LLM Inference
RangeFactory: Scalable Construction of Multi-Hop Cyber Ranges
El Agente Gr\'afico: A Semantic Execution Runtime for Scientific Agents
Social Gym and SPaRTan: Benchmarking and Improving LLM Social Reasoning via Multi-Agent G…
FreSH: Frequency-Segmented Hierarchical Multi-Expert Framework for Multivariate Time Seri…
Targeted Counterfactual Fingerprinting for Black-Box LLM Ownership Verification
When Is a Steerable Concept Representation Real? Measurement Confounds in a Cross-Family …
Biologically Informed Representation Learning for Robust Cross-Center Generalization of M…
VTO: Visual Tool Orchestration for Video Anomaly Detection
Structure-Enhanced Features and Quality-Aware Dynamic Anchor Scoring for Robust Lane Dete…
Privacy-Preserving Data Drift Detection and Recovery for Large-Scale LLM Applications via…