SkillSentry: Reliable Skill Execution for LLM Agents via Runtime Assurance
Explorar
Noticias de IA
29336 elementos — filtrados, clasificados y sin duplicados
Application of Artificial Intelligence for Fraudulent Banking Operations Recognition
Automated Generation of Complexity-Validated Decision Scenarios Using Large Language Mode…
WuYuEval: A Multi-Level Benchmark for Large Language Models in Solid Waste Management
Carnot: Interpretable, Interactive, and Optimized Execution of Deep Research Queries
TCS-BENCH: Benchmarking State-of-the-Art Generative AI Theoretical Computer Science Resea…
Embedding Trust: Semantic Isotropy Predicts Nonfactuality in Long-Form Text Generation
RankGuide: Tensor-Rank-Guided Routing and Steering for Efficient Reasoning
Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Disti…
How to Build Marcus's Algebraic Mind: Algebro-Deterministic Substrate over Galois Fields
Can LLMs Rank? A Tale of Triads and Triage
How Simple Can It Get? From Interpretable Equations to Readable Rules for Financial Decis…
Context Is Not Authority: Structured Runtime Governance for Financial Market Agents
OpenLoopEvolve: A Verifiable Self-Evolution Framework for Loop Policies in Long-Horizon C…
Evaluation of Motivational Interviewing Counsellors with Task-Aware Multi-Stage LLM-Based…
DeltaPrompts: Escaping the Zero-Delta Trap in Multimodal Distillation
Dimensional Balance Improves Large Scale Spatiotemporal Prediction Performance
HEART: Exploiting Head Heterogeneity in Sparse Attention for Video Diffusion
Efficient Cross-View Localization in 6G Space-Air-Ground Integrated Network
How Context Attribution Handles What the Model Already Knows
CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Conti…
Ground-Truth Neighborhood Regularization for Reinforcement Learning Post-Training of Time…
Adaptive Sequential Test Planning for Multi-Mechanism Reliability Qualification via Bayes…
From Trajectories to Evidence: Auditable Experimental Records for Industrial Research Age…
Software Engineering for and with GUI Agent
FemWear: A Specialized Wearable Foundation Model for Women's Health
UGAF-ITS: A Standards Harmonization Framework and Validation Tool for Multi-Framework AI …
Evaluating Jailbreaking Vulnerabilities in LLMs Deployed as Assistants for Smart Grid Ope…
Culturally Situated AI Safety for Youth: Saudi Arabian Perspectives of Youth, Parents and…
VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Eng…