SysAdmin: Measuring Instrumental Power-Seeking in Frontier AI
Explorar
Noticias de IA
30724 elementos — filtrados, clasificados y sin duplicados
Calibrated Selective Fact-Checking via Evidence Chain Evaluation
Position: AI/ML Deepfake Research is Misaligned with AI-Generated Non-Consensual Intimate…
Structured Synthetic Reasoning Data for Arithmetic Fine-Tuning of Small Language Models
Fence: Specialized SLM Guardrails for LLM Applications
Trajectory-Aware Clinical Risk Prediction via Severity-Grounded Knowledge Graphs and Retr…
Agentic Real2Sim: Physics-based World Modeling with Vision-Language Agents
Bounding Boxes to Improve Small Language Model Performance on Vision-Based Grading Tasks
Beyond Output-Space Calibration: Spectral Evidence Bundling for Selective Reliability Est…
When JSON Is Not Enough: Semantic Reliability of Schema-Constrained LLM Ordering Agents
Athena-Brain Technical Report: An Efficient Robot Brain for General Intelligence and Embo…
Provable diffusion-based posterior sampling for linear inverse problems via DDIM
Assistant or Actor? Student Trust, Control, and Delegation Regret When Using a General-Pu…
From Trajectories to Instructions: Language-Conditioned Meta-Reinforcement Learning
Towards an Automated Test of LLM Security Knowledge
A Calculus of Discernment: Decision-Relevant Insight, Sequence Value, and Forgetting as H…
FALCON-Discover: Discovering Concentrated False-Confidence Regions for Calibration
Agents in the Wild: Where Research Meets Deployment
FedCC: A Low-Resource Federated Adaptation of Foundation Models for Robust Corpus Callosu…
Edge-Efficient Transformer for End-to-End RF Spectrum Monitoring
Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evide…
CodeRescue: Budget-Calibrated Recovery Routing for Coding Agents
Graph-Based Agentic AI with LangGraph: Workflow Pathways for Long-Running Stateful Busine…
Soft-TransFormers for Continual Learning
Preference-Conditioned Multi-Objective Reinforcement Learning for Runtime-Tunable Transit…
TransDex: Pre-training Visuo-Tactile Policy with Point Cloud Reconstruction for Dexterous…
AnchorRefine: Synergy-Manipulation Based on Trajectory Anchor and Residual Refinement for…
BioSecBench-Surveillance: A Verifiable Benchmark for AI Agents in Pathogen Genomic Survei…
When Visual Evidence is Ambiguous: Pareidolia as a Diagnostic Probe for Vision Models
Memo2496: Expert-Annotated Dataset and Dual-view Adaptive Framework for Music Emotion Rec…