Intrinsically Interpretable Attention via Sparse Post-Training
Explorar
Noticias de IA
21270 elementos — filtrados, clasificados y sin duplicados
Finite-Particle Convergence Rates for Conservative and Non-Conservative Drifting Models
L-Drive: Beyond a Single Mapping-Latent Context Drives Time Series Forecasting
Persona-Model Collapse in Emergent Misalignment
One Step to the Side: Why Defenses Against Malicious Finetuning Fail Under Adaptive Adver…
Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Lang…
FactoryNet: A Large-Scale Dataset toward Industrial Time-Series Foundation Models
Real vs. Semi-Simulated: Rethinking Evaluation for Treatment Effect Estimation
E = T*H/(O+B): A Dimensionless Control Parameter for Mixture-of-Experts Ecology
Quality-Conditioned Agreement in Automated Short Answer Scoring: Mid-Range Degradation an…
MoBayes: A Modular Bayesian Framework for Separating Reasoning from Language in Conversat…
EditCaption: Human-Refined SFT and HAE-DPO for Image Editing Instruction Synthesis
Inference Time Context Sparsity: Illusion or Opportunity?
Theoretical Analysis of Sparse Optimization with Reparameterization, Weight Decay, and Ad…
Identifying and Mitigating Systemic Measurement Bias in Production LLM Inference Benchmar…
How Well Do Models Follow Their Constitutions?
HiGraph: A Large-Scale Hierarchical Graph Dataset for Malware Analysis
Prism: Spectral-Aware Block-Sparse Attention
Scalable Explainability-as-a-Service (XaaS) for Edge AI Systems
SPA-Cache: Singular Proxies for Adaptive Caching in Diffusion Language Models
Dynamics Reveals Structure: Challenging the Linear Propagation Assumption
Characterizing Linear Alignment Across Language Models
Reliable AI Needs to Externalize Implicit Knowledge: A Human-AI Collaboration Perspective
Probing the Preferences of a Language Model: Integrating Verbal and Behavioral Tests of A…
From Prompt Optimization to Multi-Dimensional Credibility Evaluation: Enhancing Trustwort…
Learning to Trust: Bayesian Adaptation to Varying Suggester Reliability in Sequential Dec…
SPARK: Search Personalization via Agent-Driven Retrieval and Knowledge-sharing
PathWise: Planning through World Model for Automated Heuristic Design via Self-Evolving L…
All Leaks Count, Some Count More: Interpretable Temporal Contamination Detection and Miti…
Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning w…