Wnuan: Staged Post-Training for Question Answering over Proprietary Enterprise Knowledge
Browse
AI News
25879 items — filtered, classified, deduplicated
Is More Privileged Information Better? From Solution Traces to Problem-Solving Structure …
ProWorld: Progress-Aware Hyperbolic World Models for Long-Horizon Visual Goal Reaching
Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories
When Memory Updates but Behavior Does Not: Repairing Implicit Stale Dependencies in Perso…
MemSIF: From Structured Interactions to Dual-Track Fact Memory for LLM Agents
EduZone: A Framework for Evaluating LLM Safety for K-12 Students and Teachers
TrajWiki: Source-Grounded Memory Trajectories for Long-Horizon Dialogue Agents
PROGRESS: Coverage-guided RL to Train Search-augmented LLM Agent
Passing Coarse Marginal Checks Can Be Cheap: Persona Mixtures and Imprecise Treatment-Res…
Can You Trust the Confidence? ConfBench for Vision-Language Models on Document Extraction
Diagnosing Search Behavior and Failure Modes in Long-Horizon Search Agents
MemArbiter: Decision-Time Memory Arbitration for Long-Horizon LLM Agents
MEGRAG: Multi-Granular Evidence Graphs for Answer-Aware Multi-Hop RAG
Cooperative Coevolution for Resource-Constrained Agentic LLM Post-Training
RubricReviewer: From Direct Critique to Objective and Comprehensive Rubric-Driven Peer Re…
Auditing Discovery Claims: A Two-Sided Criterion for Agentic Science, with the Negative S…
AgentMemBench: A Systematic Benchmark for Evaluating Long-Term Memory Management Strategi…
AgentSLABench: Evaluating and Benchmarking Agentic Systems Under Resource Constraints
The Scaling Paradox in Human-AI Collaboration
From AI Technical Debt to Agentic Technical Debt: A Systematic Mapping of Root Causes and…
Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets
Toward Fine-Grained Forgetting:Attribute Unlearning for Multimodal Large Language Models
FactorJEPA: Factorizing Monolithic Futures into Layout-Agent-Interaction Channels for Cro…
Assuming You Knew: Fixing an Epistemic Semantics for Flow Policies Using Agentic AI
Cross-Fitted Residual Utility for Primary-Preserving Cognitive Decision Correction in Aut…
AI-Based Thesis Assessment: An Empirical Study of Human Evaluation Priorities and Their I…
Measurement Without Validity: The Compounding Reliability Problem in Agentic AI Evaluation
Multi-Dimensional Assessment for AI Cognition (MAAC): A Theoretical Framework for Process…
Tracing the Cascade: A Topology-Aware Evaluation Framework for Scientific Agent Hallucina…