HINT-SD: Targeted Hindsight Self-Distillation for Long-Horizon Agents
Explorar
Noticias de IA
37834 elementos — filtrados, clasificados y sin duplicados
A Multi-Modal AI Framework for Real-Time Queue Prediction, Management and Optimisation in…
SymbolLKG: Towards Verifiable Logical Reasoning via Logical Knowledge Graph and Symbolic …
BrailleBench: Investigating Multi-Criteria Braille Comprehension in Large Language Models
A Unified Conditional Flow for Motion Generation, Editing, and Intra-Structural Retargeti…
Unsupervised Post-Training of Foundation Models: A Survey
DeepPlanner: Scaling Planning Capability for Deep Research Agents via Advantage Shaping
Temporally-Grounded Language Generation: Towards Real-Time Vision-Language Models
Pushing the Envelope of LLM Inference with Ultra-Low-Bit Quantized Models
SHIFT: Semantic Harmonization via Index-side Feature Transformation for Multilingual Info…
Learning New Facts with QLoRA: An Acquisition-Retention Frontier
Counterfactual Bias Testing for Application Tracking System
AI agents in Algorithmic Electricity Markets: On the Emergence of Tacit Collusion
SWE-Prime: Fewer Trajectories, Better Performance
LLM-Powered Swarms: A New Frontier or a Conceptual Stretch?
MambaCSP: Hybrid-Attention State Space Models for Hardware-Efficient Channel State Predic…
Pixel Wised Lesion Prediction on COVID-19 CT Imagery: A Comparative Analysis of Automated…
No Plan, Yet Human: A Reactive Robotics Model Predicts Human Planning Failures on a Clini…
Discovering Relationships in Data Lakes Using Large Language Models: An Industrial Case
FaithSieve: Fine-Grained Evaluation of Math Proofs with Faithful Formal Evidence
NeuronFuzz: Safety Neuron Guided Fuzzing for LLM Safety Evaluation
KnockGS:interaction-Grounded Calibrationof Physical Gaussian Representations
Categorizer Automata for Discounted-Sum Payoffs
DEEPCHART: How Far are LLMs from Faithful Data-Science Chart Generation?
ADeptS-Bench: Measuring the Trustworthiness of Computer Use Agents Across Devices
AgentFold: Closed-Loop Agentic Search for Protein Folding Model Design
How Do LLM Agents Actually Get the Flag? Trace-Level Provenance for Agentic Offensive Sec…
Style as a Confound: False Positives in AI Detection of Non-Native Academic Writing
Accelerating Scientific Research with Gemini in the Real-World
PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents