Symmetry Defeats Auditing
Explorar
Noticias de IA
1057 elementos — filtrados, clasificados y sin duplicados
Technical Report: Exploring the Emerging Threats of the Agent Skill Ecosystem
Blind PRNG Hijacking: An Undetectable Integrity-Preserving Attack Against LLM Watermarking
MIRAGE: Context-Aware Prompt Injection against Mobile GUI Agents via User-Generated Conte…
SNARE: Adaptive Scenario Synthesis for Eliciting Overeager Behavior in Coding Agents
Semantic-level Backdoor Attack against Text-to-Image Diffusion Models
Colosseum: Auditing Collusion in Cooperative Multi-Agent Systems
The Obfuscation Atlas: Mapping Where Honesty Emerges in RLVR with Deception Probes
Securing Retrieval-Augmented Generation: A Taxonomy of Attacks, Defenses, and Future Dire…
Debate with Images: Detecting Deceptive Behaviors in Multimodal Large Language Models
HARP: Measuring Harm Amplification in Multi-Agent LLM Systems
Backdoor Attacks on Fault Detection and Localization in Cyber-Physical Systems
Disentangling Adversarial Prompts: A Semantic-Graph Defense for Robust LLM Security
SPARD: Defending Harmful Fine-Tuning Attack via Safety Projection with Relevance-Diversit…
Plant, Persist, Trigger: Sleeper Attack on Large Language Model Agents
Defending LLM-based Multi-Agent Systems Against Cooperative Attacks with Sentence-Level R…
Grimlock: Guarding High-Agency Systems with eBPF and Attested Channels
A Wolf in Sheep's Clothing: Targeted Routing Hijacking in Federated RAG
Defending LLM-based Multi-Agent Systems Against Cooperative Attacks with Sentence-Level R…
SilentRetrieval: Hijacking Retrieval-Augmented Generation via Semantically-Preserving Adv…
Indian Government, Tech Firms Running Tests for Mythos Threat
Cordyceps: Covert Control Attacks on LLMs via Data Poisoning
Black-box Membership Inference Attacks on the Pre-training Data of Image-generation Models
Erased but Exploitable: Black-box Embedding-Aware Prompting Against Unlearned Text-to-Ima…
SkillSieve: A Hierarchical Triage Framework for Detecting Malicious AI Agent Skills
Turning Bias into Bugs: Bandit-Guided Style Manipulation Attacks on LLM Judges
Tracing the Dynamics of Refusal: Exploiting Latent Refusal Trajectories for Robust Jailbr…
Cryptographic Registry Provenance: Structural Defense Against Dependency Confusion in AI …
Eroding Trust in Real Speech: A Large-Scale Study of Human Audio Deepfake Perception
Furina: Fragmented Uncertainty-Driven Refusal Instability Attack