Playing ZendoWorld: Challenging AI Agents on Active Visual Concept Induction
Explorar
Noticias de IA
30934 elementos — filtrados, clasificados y sin duplicados
AutoPersonas: A Multi-Timescale Loop Engine for Open-Ended Persona Evolution
Compete Then Collaborate: Frontier AI Teachers Build a Verifiable Curriculum to Improve a…
Closed-Loop Dynamic Validator Node Scaling in Private Substrate Blockchains Using Takagi-…
Mechanistic Interpretability of LLM Jailbreaks via Internal Attribution Graphs
Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datas…
Efficient Safety Alignment of Language Models via Latent Personality Traits
Beyond Thermal Imaging: Inferring Thermophysical Properties from Time-Resolved Thermal Ob…
path_boost: A Python Package for Interpretable Graph-Level Prediction using Path-Based Gr…
When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforceme…
3100 Opinions on Code Review in an AI World: Building Causal Theory from Practitioner Dis…
MentalHospital: A Virtual Environment for Evaluating Psychiatric Clinical Encounters
Understanding Axes of Difficulty For Long Context Tasks Via PredicateLongBench
INTENT: An LSTM Framework for Vehicle Intention Prediction in Intersection Scenarios with…
A Reliability Assessment of LALM Audio Judges for Full-Duplex Voice Agents
Reaction-network reasoning with frontier models for experimentally confirmed catalyst-sel…
MobiDiff: Semantic-Aware Multi-Channel Discrete Diffusion for Human Mobility Data Generat…
Who Broke the System? Failure Localization in LLM-Based Multi-Agent Systems
FedOPAL: One-Shot Federated Learning via Analytic Visual Prompt Tuning
SpO$_2$ Predictor-Guided Stage-Wise Time-Frequency Reconstruction of Low-Quality Dual-Wav…
Game Theory Driven Multi-Agent Framework Mitigates Language Model Hallucination
Provably Optimal Learning Algorithms for Assistance Games
Can We Trust LLM's Logic? Quantifying Uncertainty, Coherence, and Robustness via a Graph-…
APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts
OmniFood-Bench: Evaluating VLMs for Nutrient Reasoning and Personalized Health Advice
AI-guided stimuli discovery and generation to optimize facial emotion perception studies …
CommuniWave:A Machine Learning Model for Quantifying the Degree of Temporary Informal Beh…
PLURAL: A Global Dataset for Value Alignment
Towards Precision Therapy in Hepatocellular Carcinoma: A Clinical-Reasoning LLM for Risk …
Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents