Defending against Adaptive Prompt Injection Attacks via Reasoning-enabled Task Alignment
Explorar
Noticias de IA
1359 elementos — filtrados, clasificados y sin duplicados
Ukraine's one-time test used fully autonomous drones to kill Russian soldiers
Google sues alleged Chinese cybercrime operation that used AI to send scam texts
Google sues Chinese cybercrime network that used Gemini to automate scams
Google sues Chinese scammers using Gemini AI for fraud
Scammers Used Gemini AI to Help Build Spam Messages, Google Says
AI agent bankrupted their operator while trying to scan DN42
SAIGuard: Communication-State Simulation for Proactive Defense of LLM Multi-Agent Systems
Unsafer in Many Turns: Benchmarking and Defending Multi-Turn Safety Risks in Tool-Using A…
FENCE: A Financial and Multimodal Jailbreak Detection Dataset
Efficient, Robust, and Anti-Collusion Fingerprinting of Image Diffusion Models
SMSR: Certified Defence Against Runtime Memory Poisoning in Persistent LLM Agent Systems
A Survey on Long-Term Memory Security in LLM Agents: Attacks, Defenses, and Governance Ac…
The Emergence of Autonomous Penetration Capabilities in Large Language Model-Powered AI S…
Who Pays the Price? Stakeholder-Centric Prompt Injection Benchmarking for Real-world Web …
MAStrike: Shapley-Guided Collusive Red-Teaming on Multi-Agent Systems
The Containment Gap: How Deployed Agentic AI Frameworks Fail Public-Facing Safety Require…
Reframing AI Loss of Control: What It Is, How to Have It, How to Lose It
PolicyGuard: Towards Test-time and Step-level Adversary Defense for Reinforcement Learnin…
PI-Hunter: Automated Red-Teaming for Exposing and Localizing Prompt Injections
ChatGPT Pushed Back on LA Fire Suspect’s Vision of Burning City
Grok Is Still Hosting Sexualized Deepfakes of Famous Women
Former xAI Staffer Says He Was Fired for Questioning Grok Safety
OpenAI says fake accounts from China tried to turn Americans against data centers
Robust Privacy: Inference-Stage Privacy through Certified Robustness
Grammar-Constrained Decoding Can Jailbreak LLMs into Generating Malicious Code
MPC-Patch-Bench: Security-Aware LLM Code Patch for Multi-Party Computation
T2S: A Rehearsal-Based Approach for Extraction-Resistant Model Watermarking
Can Open-Source LLM Agents Replace Static Application Security Testing Tools? An Empirica…
Runtime Skill Audit: Targeted Runtime Probing for Agent Skill Security