One Step to the Side: Why Defenses Against Malicious Finetuning Fail Under Adaptive Adver…
Browse
AI News
30934 items — filtered, classified, deduplicated
Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Lang…
FactoryNet: A Large-Scale Dataset toward Industrial Time-Series Foundation Models
Real vs. Semi-Simulated: Rethinking Evaluation for Treatment Effect Estimation
E = T*H/(O+B): A Dimensionless Control Parameter for Mixture-of-Experts Ecology
Quality-Conditioned Agreement in Automated Short Answer Scoring: Mid-Range Degradation an…
MoBayes: A Modular Bayesian Framework for Separating Reasoning from Language in Conversat…
EditCaption: Human-Refined SFT and HAE-DPO for Image Editing Instruction Synthesis
Inference Time Context Sparsity: Illusion or Opportunity?
Uncovering Vulnerabilities of LLM-Assisted Cyber Threat Intelligence
Theoretical Analysis of Sparse Optimization with Reparameterization, Weight Decay, and Ad…
Identifying and Mitigating Systemic Measurement Bias in Production LLM Inference Benchmar…
How Well Do Models Follow Their Constitutions?
HiGraph: A Large-Scale Hierarchical Graph Dataset for Malware Analysis
Prism: Spectral-Aware Block-Sparse Attention
Scalable Explainability-as-a-Service (XaaS) for Edge AI Systems
SPA-Cache: Singular Proxies for Adaptive Caching in Diffusion Language Models
Dynamics Reveals Structure: Challenging the Linear Propagation Assumption
Characterizing Linear Alignment Across Language Models
Reliable AI Needs to Externalize Implicit Knowledge: A Human-AI Collaboration Perspective
Probing the Preferences of a Language Model: Integrating Verbal and Behavioral Tests of A…
From Prompt Optimization to Multi-Dimensional Credibility Evaluation: Enhancing Trustwort…
Learning to Trust: Bayesian Adaptation to Varying Suggester Reliability in Sequential Dec…
Jailbreak to Protect: Buffering and Reinforcing via Temporary Jailbreaking for Safe Fine-…
SPARK: Search Personalization via Agent-Driven Retrieval and Knowledge-sharing
PathWise: Planning through World Model for Automated Heuristic Design via Self-Evolving L…
All Leaks Count, Some Count More: Interpretable Temporal Contamination Detection and Miti…
Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning w…
Procedural Refinement by LLM-driven Algorithmic Debugging for ARC-AGI-2
RCTs & Human Uplift Studies: Methodological Challenges and Practical Solutions for Fronti…