Furina: Fragmented Uncertainty-Driven Refusal Instability Attack
Explorar
Noticias de IA
1359 elementos — filtrados, clasificados y sin duplicados
Cordyceps: Covert Control Attacks on LLMs via Data Poisoning
Black-box Membership Inference Attacks on the Pre-training Data of Image-generation Models
Securing Multi-Agent Systems Against Corruptions via Node Contribution Backpropagation
MemMorph: Tool Hijacking in LLM Agents via Memory Poisoning
Cordon-MAS: Defending RAG against Knowledge Poisoning via Information-Flow Control
Cryptographic Registry Provenance: Structural Defense Against Dependency Confusion in AI …
GraphIP-Bench: How Hard Is It to Steal a Graph Neural Network, and Can We Stop It?
MRMMIA: Membership Inference Attacks on Memory in Chat Agents
Disentangling Adversarial Prompts: A Semantic-Graph Defense for Robust LLM Security
Millions of AI agents imperiled by critical vulnerability in open source package
FBI agent explains how easy it is to ID people posting AI porn without consent
Do Modern Post-Hoc Watermarking Methods Beat Broken-Arrows?
Black-box Membership Inference Attacks on the Pre-training Data of Image-generation Models
BNP Paribas Works With Mistral to Prep for Mythos-Like AI Models
Concept Drift Adaptation Using Self-Supervised and Reinforcement Learning In Android Malw…
Reasoning as an Attack Surface: Adaptive Evolutionary CoT Jailbreaks for LLMs
Benchmarking and Improving Monitors for Out-Of-Distribution Alignment Failure in LLMs
SafeGPT: Preventing Data Leakage and Unethical Outputs in Enterprise LLM Use
How does Bayesian Sampling help Membership Inference Attacks?
RiskBridge: Turning CVEs into Business-Aligned Patch Priorities
Committed SAE-Feature Traces for Audited-Session Substitution Detection in Hosted LLMs
Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimi…
An Empirical Evaluation of LLM-Generated Code Security Across Prompting Methods
Demystifying the Mythos or Disrupting Bugonomics? From Zero-Day Asymmetry to Defender Rem…
Security in the Fine-Tuning Lifecycle of Large Language Models: Threats, Defenses,Evaluat…
Evo-Attacker: Memory-Augmented Reinforcement Learning for Long-Horizon Tool Attacks on LL…
MCPXKIT: The Unified Toolkit for Analyzing Model Context Protocol Security
AI-Driven Adaptive Adversaries and the Erosion of Cryptographic Trust in Public Key Syste…
Batch Normalization Amplifies Memorization and Privacy Risks