Oversight Has a Capacity: Calibrating Agent Guards to a Subjective, Fatiguing Human
Explorar
Noticias de IA
1359 elementos — filtrados, clasificados y sin duplicados
For the 2nd time in weeks, Microsoft packages laced with credential stealer
Meta Deletes Face-Recognition System From Its Smart Glasses App After WIRED Report
Reddit ads pose as news stories to promote AI investment scams
Unveiling Privacy Risks in Multi-modal Large Language Models: Task-specific Vulnerabiliti…
Context-Fractured Decomposition Attacks on Tool-Using LLM Agents: Exploiting Artifact Pro…
Attack Selection in Agentic AI Control Evaluations Meaningfully Decreases Safety
EVA: Evolving Semantic Adversaries for Red-Teaming GUI Agents Against Environmental Injec…
RAVEN: Retrieval-Augmented Vulnerability Exploration Network for Memory Corruption Analys…
Extracting Recurring Vulnerabilities from Black-Box LLM-Generated Software
It's a TRAP! Task-Redirecting Agent Persuasion Benchmark for Web Agents
Latent-space Attacks for Refusal Evasion in Language Models
MalTree: Tracing Malware Evolution from Embeddings at Scale
Zero-Shot Embedding Drift Detection: A Lightweight Defense Against Prompt Injections in L…
OpenAI unveils Lockdown Mode to protect sensitive data from prompt injection attacks
Meta confirms 1000s of Instagram accounts were hacked by abusing its AI chatbot
Crypto-Funded Chinese Peptide Labs Are Booming
Bitcoin drops below $60,000, despite Trumps embrace
OpenAI rolls out a Lockdown Mode for extra protection against prompt injection attacks
Rubrik CEO's Big AI Warning
The Meta hack shows there’s more to AI security than Mythos
Coding with "Enemy": Can Human Developers Detect AI Agent Sabotage?
From Reward-Hack Activations to Agentic Risk States: Context-Calibrated Mechanistic Monit…
Beyond Waveform Robustness: Robust Feature-Vocoder Adversarial Attacks on Automatic Speec…
AttackPathGNN: Cross-function vulnerability detection in smart contracts using state inte…
TinyML-Driven Cybersecurity for Autonomous Spacecraft: Latency-Accuracy Analysis for SPAR…
Cognitive Threat Intelligence and Explainable Federated Security Analytics for distribute…
Data Flow Control: Data Safety Policies for AI Agents
SlotGCG: Exploiting the Positional Vulnerability in LLMs for Jailbreak Attacks
Safety Paradox: How Enhanced Safety Awareness Leaves LLMs Vulnerable to Posterior Attack