Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Age…
Explorar
Noticias de IA
27413 elementos — filtrados, clasificados y sin duplicados
verdi: retrieval is not transfer for continual world model optimization
How People Evaluate AI-, Expert-, and Peer-Style Financial Advice
TokenPrint: A Calibrated Token-Space Fingerprint for Language-Model Provenance
Janus: An Algorithm-Evaluator Co-Evolution Framework for LLM-Driven Discovery under Expen…
Private Etymology: Designing Relational Reuse of Shared Symbols in Long-Term Human-AI Int…
Human-Guided Causal Knowledge Injection for Virtual Cells
From Product Search to Preference Articulation: The Economics of Agentic Commerce
Renormalising Generative Models for Active Inference: Foundations, Derivations, and Verif…
From Trajectories to Evidence: Auditable Experimental Records for Industrial Research Age…
From Prompt to Harness: Coderlet from Scratch
Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questi…
Dramarrator: Object-Based Audio Editing for Audio Drama Production from Books
Application of Artificial Intelligence for Fraudulent Banking Operations Recognition
Coupled Graph--Policy Distillation for Personalized Medication Safety in Older Adults wit…
Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution
Three Necessary Principles for Self-Supervised Visual Representation Learning
UniSpace: Unified Visual Representation and Scalable Multimodal Modeling
OpenLoopEvolve: A Verifiable Self-Evolution Framework for Loop Policies in Long-Horizon C…
CircuitReason-1k: Benchmarking Long-Horizon Visual-to-Symbolic Reasoning inElectrical Cir…
LLM-Guided Heuristic Design from Simulation Traces: A Case Study in Dynamic Production an…
Positioning Generative Artificial Intelligence in STEM Assessment: When to Require, Scaff…
GeoPhysAdapter: Scale-Matched Geophysical Adaptation for Cross-Domain Landslide Mapping w…
CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning
LibraSpec: Dynamic Diffusion-Based Speculative Decoding via Marginal-Gain-Driven Optimiza…
Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Pro…
CADEngBench: It Looks Like CAD, but Does It Work? Evaluating Parametric Design, Assembly …
Population-Scalable Multi-Agent World Modeling
STEMMA: An Adversarial Multi-Agent Framework for Evaluating Self-Identity Consistency in …
Evidence-RL: Towards Evidence-intensive Visual Reasoning