Margin-Adaptive Confidence Ranking for Reliable LLM Judgement
Explorar
Noticias de IA
22099 elementos — filtrados, clasificados y sin duplicados
Evaluating Design Video Generation: Metrics for Compositional Fidelity
Full Attention Strikes Back: Transferring Full Attention into Sparse within Hundred Train…
ConflictRAG: Detecting and Resolving Knowledge Conflicts in Retrieval Augmented Generation
Post-Trained MoE Can Skip Half Experts via Self-Distillation
Diagnosing Multi-step Reasoning Failures in Black-box LLMs via Stepwise Confidence Attrib…
Weak-Driven Learning: How Weak Agents make Strong Agents Stronger
Causal Unlearning in Collaborative Optimization: Exact and Approximate Influence Reversal…
CrossVLA: Cross-Paradigm Post-Training and Inference Optimization for Vision-Language-Act…
Language-based Trial and Error Falls Behind in the Era of Experience
SKILL.nb: Selective Formalization and Gated Execution for Durable Agent Workflows
A Multi-modal Agentic Co-pilot for Evidence Grounded Computational Pathology
When Does Delegation Beat Majority? A Delegation-Based Aggregator for Multi-Sample LLM In…
Think Before You Act: Intention-Guided Reasoning for LLM-Based Location Prediction
SAGE: An LLM-driven Self Reflective Agentic Framework for Fraud Detection
SciTrace: Trajectory-Aware Safety Reasoning for Scientific Discovery Agents
When No Answer Is Correct: Diagnosing Absent Answer Detection for MLLMs in Video Understa…
Overcoming the Regulatory Bottleneck via Agent-to-Agent Protocols: A Nuclear Case Study
The AI Epistemic Deference Index: A Continuous Measure of Sycophancy
EditSR: Enhancing Neural Symbolic Regression via Edit-based Rectification
Stress-testing medical large language models reveals latent safety pathology beyond bench…
PAFO: Pareto Fairness Optimization for Personalized Reward Modeling
UniQL: Towards Dialect-Universal Benchmarking for Text-to-SQL
Standpoint Logics with Defeasible Beliefs
Scaffold Effects on GAIA: A Controlled Comparison
AgentTrust: A Self-Improving Trust Layer for AI-Agent Actions
PAEC: Position-Aware Entropy Calibration for LLM Reasoning in RLVR
Distilling LLM Reasoning into an Interpretable Policy Tree for Human-AI Collaboration
InA-Probe: Instruction-Aware Active Probing for Time Series Forecasting with LLMs
Extending Ontologies: From Dense Embeddings to Hybrid Quantum-Fuzzy Systems