A Close Look At World Model Recovery In Supervised Fine-Tuned LLM Planners
Explorar
Noticias de IA
29347 elementos — filtrados, clasificados y sin duplicados
Leave it to the Specialist: Repair Sparse LLMs with Sparse Fine-Tuning via Sparsity Evolu…
Distribution-Calibrated Inference Time Compute for Thinking LLM-as-a-Judge
Uncertainty-Aware Clarification in LLM Agents with Information Gain
ConTraIRL: Factorized Contrastive Abstractions for Transferable IRL
Geometry-Aware Tabular Diffusion
Aletheia: What Makes RLVR For Code Verifiers Tick?
EntangleCodec: A Unified Discrete Audio Tokenizer via Semantic-Acoustic Entanglement
Enhancing Operational Safety via Agentic Dialogue Hazard Identification Analysis
Code-on-Graph: Iterative Programmatic Reasoning via Large Language Models on Knowledge Gr…
TSQAgent: Rating Time Series Data Quality via Dedicated Agentic Reasoning
Towards Non-Monotonic Entailment in Propositional Defeasible Standpoint Logic
A Negative Result on Cross-Model Activation Transfer in a Pythia Multi-Hop Setting
MedCUA-Bench: A Screenshot-Only Benchmark for Clinical Computer-Use Agents
See Less, Specify More: Visual Evidence Budgets for Generalizable VLAs
Perceive Before Reasoning: A Pre-Reasoning Perception Framework for Efficient and Reliabl…
Narrow Secret Loyalty Dodges Black-Box Audits
OpenAgenet/OAN: Open Infrastructure for Trusted Agent Interconnection
DDOR: Delta Debugging for Explainable Overrefusal Testing and Repair
BaltiVoice: A Speech Corpus and Fine-tuned Whisper ASR System for the Balti Language
A Hybrid Approach For Malware Classification Using Secondary Features Fusion
BAHSD: Bridging the Long-tail Gap via Adaptive Distillation in Black-box Sequential Recom…
AI Rater Discrimination Depends on Scoring Protocol in Complex Clinical Decision-Making
WebRISE: Requirement-Induced State Evaluation for MLLM-Generated Web Artifacts
AI-Generated Traces for Novice Programmers: Learning Effects and Learner Differences in a…
RobotValues: Evaluating Household Robots When Human Values Conflict
FLIPS: Instance-Fingerprinting for LLMs via Pseudo-random Sequences
Physics-Guided Policy Optimization with Self-Distillation
Safety Measurements for Fine-tuned LLMs Should be Grounded in Capability
Evaluating Transformer and LSTM Frameworks for Prediction in Ungauged Basins