KnowHal: A Knowledge-Driven Benchmark for Comprehensive Multimodal Hallucination Evaluati…
Explorar
Noticias de IA
29629 elementos — filtrados, clasificados y sin duplicados
Large language models for partial differential equation workflows
When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation
Balancing Efficiency and Efficacy: Training-Free Attention-Guided Switching Between Expli…
Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Fre…
UniGD: A Unified Generative-Discriminative Framework for Industrial Retrieval
HyperAgent: Planning and Acting over Tool-Schema Hypergraphs for Tool-Use LLM Agents
Policy Fragmentation or Institutional Alignment? Institutional Governance of AI in Univer…
AI World Cup 2026: Benchmarking Large Language Models for End-to-End Football Tournament …
Enactive Artificial Intelligence: A Decision-Centric Architecture for Complex Systems
Towards Improving Sequential Decision-Making in LLM Agents via Experience Memory
Hybrid LLM-Augmented Reinforcement Learning Agents for Complex Sequential Decision Tasks
Dr. AGENTONOMICS: A Didactic Experiment of AGENTONOMICS
Permission Denied: Policy-Graded Evaluation of Coding Agents in Hardened Environments
When Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Rea…
Learning Clinical-Trial Strategy: Offline Policy Training for Decision Agents
Diversity is Not Ambiguity: Toward Accurate and Efficient Ambiguity Detection for Open-Do…
LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models
One Knob to Rule Them All: A Unified Optimal Transport View of Cold-Start Active Learning
IR2Solve: Structured Intermediate Representations for Cost-Efficient Optimization Autofor…
Instruction Stacking Collapse: A Benchmark and the Capability-Dependent Value of Prompt C…
DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces
Measuring Explainer Stability via Attribution Separability
UrbanAgent: A Tool-Augmented Agent for Cross-System Urban Tasks
Agentic Reinforcement Learning with Self-Distilled Reward Shaping
Hypercubes, Hyperplanes, and Constraint-Induced Complexity Collapse in Atomic Concept Lea…
TACT: Taxonomy-Aligned Post-Training for Pedagogically Adaptive English Tutoring
GraphCliff: Short-Long Range Gating for Modeling Critical Activity Changes Caused by Subt…
MAFIA: Query-Only Memory Attacks via Probing and Factual Injection against Audited LLM Ag…
ADMITBench: A Safety-Governed Reference Framework for Evaluating the Admissibility of Ind…