TukaBench: A Culturally Grounded Jailbreak Benchmark for African Languages
Explorar
Noticias de IA
27413 elementos — filtrados, clasificados y sin duplicados
Latent Reward Steering: An Adaptive Inference-Time Framework that Implicitly Promotes Cog…
TRACE: Trajectory Risk-Aware Compression for Long-Horizon Agent Safety
TAPS: Target-Aware Prefix Tree Selection for Diffusion-Drafted Speculative Decoding
Weak Critics Make Strong Learners: On-Policy Critique Distillation for Scalable Oversight
VESTA: Visual Exploration with Statistical Tool Agents
Evaluating Bivariate Causal Statements Based on Mutual Compatibility
Capability Self-Assessment: Teaching LLMs to Know Their Limits
Deliberative Curation: A Protocol for Multi-Agent Knowledge Bases
Consistency evaluation of benchmarks used for causal discovery
TimeSage-MT: A Multi-Turn Benchmark for Evaluating Agentic Time Series Reasoning
GJDNet: Robust Graph Neural Networks via Joint Disentangled Learning Against Adversarial …
FAF-CD: Frequency-Aware Fusion for Change Detection under Imperfect Multimodal Remote Sen…
ZX-Calculus:Trace-Indexed Dependent Types and Epistemic Semantics
TriEval: A Resource-Efficient Pipeline for LLM Bias, Toxicity, and Truthfulness Assessment
Inducing Reasoning Primitives from Agent Traces
Transforming rare cancer research with Amazon Quick: Integrating biomedical databases for…
RoboDream: Compositional World Models for Scalable Robot Data Synthesis
IntraShuffler: A Privacy Preserving Framework for Heterogeneous DP Federated Learning
Humanoid Hands Are AI’s Real Test
Tracking the Behavioral Trajectories of Adapting Agents
Drifting Preference Optimization for One-Step Generative Models
GloResNet: A lightweight 3D CNN with global topological features for preterm brain injury…
Expressivity of congruence-based architectures for DNNs on positive-definite matrices
AI Agent Guidelines for CS336 at Stanford
Learning When to Translate for Multilingual Reasoning
Active Exploring like a Pigeon: Reinforcing Spatial Reasoning via Agentic Vision-Language…
Spectral Audit of In-Context Operator Networks
Evolutionary Discovery of Bivariate Bicycle Codes with LLM-Guided Search
Honey, I Shrunk the Arc de Triomphe!