Momentum for Reasoning: Dense Intrinsic Signals in Policy Optimization
Explorar
Noticias de IA
29629 elementos — filtrados, clasificados y sin duplicados
Q-Delta: Beyond Key-Value Associative State Evolution
Bridging Expert Knowledge and Automated Feature Engineering via Self-Evolution
Beware of GeeksBearing Gifts: Building True EU Frontier AI Sovereignty
Structure-Conditioned Actor-Critic Branches for Quality-Diversity Reinforcement Learning
ConMem: Structured Memory-Guided Adaptation in Training-Free Multi-Agent Systems
Extending Ontologies: From Dense Embeddings to Hybrid Quantum-Fuzzy Systems
InA-Probe: Instruction-Aware Active Probing for Time Series Forecasting with LLMs
Distilling LLM Reasoning into an Interpretable Policy Tree for Human-AI Collaboration
PAEC: Position-Aware Entropy Calibration for LLM Reasoning in RLVR
AgentTrust: A Self-Improving Trust Layer for AI-Agent Actions
Scaffold Effects on GAIA: A Controlled Comparison
Standpoint Logics with Defeasible Beliefs
UniQL: Towards Dialect-Universal Benchmarking for Text-to-SQL
VATS: Exploiting Implicit Authority in Error-Path Injection via Systematic Mutation
PAFO: Pareto Fairness Optimization for Personalized Reward Modeling
Shared Latent Structures Enable Unified Backdoor Detection and Mitigation in LLMs
Stress-testing medical large language models reveals latent safety pathology beyond bench…
EditSR: Enhancing Neural Symbolic Regression via Edit-based Rectification
The AI Epistemic Deference Index: A Continuous Measure of Sycophancy
Overcoming the Regulatory Bottleneck via Agent-to-Agent Protocols: A Nuclear Case Study
When No Answer Is Correct: Diagnosing Absent Answer Detection for MLLMs in Video Understa…
SciTrace: Trajectory-Aware Safety Reasoning for Scientific Discovery Agents
SAGE: An LLM-driven Self Reflective Agentic Framework for Fraud Detection
Think Before You Act: Intention-Guided Reasoning for LLM-Based Location Prediction
When Does Delegation Beat Majority? A Delegation-Based Aggregator for Multi-Sample LLM In…
A Multi-modal Agentic Co-pilot for Evidence Grounded Computational Pathology
SKILL.nb: Selective Formalization and Gated Execution for Durable Agent Workflows
Audio-FLAN: An Instruction-Following Dataset for Unified Audio Understanding and Generati…
LoTUS: Large-Scale Machine Unlearning with a Taste of Uncertainty