A Negative Result on Cross-Model Activation Transfer in a Pythia Multi-Hop Setting
Explorar
Noticias de IA
27413 elementos — filtrados, clasificados y sin duplicados
CARVE: Certified Affordable Repair of Vetoed Maneuvers via Envelopes for Interactive Driv…
Lean-GAP: A Dataset of Formalized Graduate Algebra Problems
Closed-Loop Molecular Design with Calibrated Deference
TadA-Bench: A Million-Variant Benchmark for Future-Round Discovery Toward Agentic Protein…
Cross-Modal Contrastive Learning of ECG and Angiography Representations for Severe Stenos…
Entropy Is Not Enough: Unlocking Effective Reinforcement Learning for Visual Reasoning vi…
Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models
Cost-Aware Query Routing in RAG: Empirical Analysis of Retrieval Depth Tradeoffs
VistaHop: Benchmarking Multi-hop Visual Reasoning for Visual DeepSearch
IdiomX A Multilingual Benchmark for Idiom Understanding, Retrieval, and Interpretation
BigFinanceBench: A Workflow-Grounded Benchmark for Financial-Research Agents
PyraMathBench: Evaluating and Improving Mathematical Capability in Large Language Models
Reasoning Structure of Large Language Models
VeRO: A Harness for Agents to Optimize Agents
From Control Boundary to Insurance Claim: Reconstructing AI-Mediated Losses Through the C…
Leveraging BART to Assess CS1 C++ Programming Assignments using Rubric-based Criteria
Perceive Before Reasoning: A Pre-Reasoning Perception Framework for Efficient and Reliabl…
ConTraIRL: Factorized Contrastive Abstractions for Transferable IRL
From Context to Skills: Can Language Models Learn from Context Skillfully?
AUGUSTE: Online-Learning dApp for Predictive URLLC Scheduling
Staying Alive: Uncensored Survival Analysis with Tabular Foundation Models
NetKV: Network-Aware Decode Instance Selection for Disaggregated LLM Inference
FLARE: Fine-Grained Diagnostic Feedback for LLM Code Refinement
TurtleAI: Benchmarking Multimodal Models for Visual Programming in Turtle Graphics
Building Reliable Long-Form Generation via Hallucination Rejection Sampling
AnchorMoE: Interpretable Time Series Classification via Anchor-Routed MoE
Re-Evaluating Continual Learning with Few-Shot Adaptation
PHASER: Phase-Aware and Semantic Experience Replay for Vision-Language-Action Models
CauTion: Knowing When to Trust LLMs for Ensemble Causal Discovery