Unveiling the Structure of Do-Calculus Reasoning via Derivation Graphs
Explorar
Noticias de IA
29348 elementos — filtrados, clasificados y sin duplicados
When to Re-Plan: Subgoal Persistence in Hierarchical Latent Reasoning
LAP: An Agent-to-Instrument Protocol for Autonomous Science
Reproducibility is the New Copyleft: Defining AGI-oriented Reproducible Builds
VistaHop: Benchmarking Multi-hop Visual Reasoning for Visual DeepSearch
From Answers to States: Verifiable Process-Level Evaluation of Chemical Reasoning in Larg…
The DeepSpeak-Agentic Dataset
CORE: Conflict-Oriented Reasoning for General Multimodal Manipulation Detection
From Prompt to Service: An SLM-Based Agent Orchestration Gateway for AI-Driven Virtual Wo…
DELTAMEM: Incremental Experience Memory for LLM Agents via Residual Trees
WISE-HAR: A Generalizable Ensemble Deep Learning Framework for WiFi-Based Human Activity …
PSViT: A Methodology for Structurally Pruning Spiking Vision Transformers
DDOR: Delta Debugging for Explainable Overrefusal Testing and Repair
BaltiVoice: A Speech Corpus and Fine-tuned Whisper ASR System for the Balti Language
A Hybrid Approach For Malware Classification Using Secondary Features Fusion
What Benchmarks Don't Measure: The Case for Evaluating Abstention Competence in Autonomou…
When RLHF Fails: A Mechanistic Taxonomy of Reward Hacking, Collapse, and Evaluator Gaming
BAHSD: Bridging the Long-tail Gap via Adaptive Distillation in Black-box Sequential Recom…
AI Rater Discrimination Depends on Scoring Protocol in Complex Clinical Decision-Making
Large AI Models in Dental Healthcare: From General-Purpose Systems to Domain-Specific Fou…
WebRISE: Requirement-Induced State Evaluation for MLLM-Generated Web Artifacts
AI-Generated Traces for Novice Programmers: Learning Effects and Learner Differences in a…
Don't Gamble, GAMBLe: An Analytical Framework for AI-Driven Research Systems
RobotValues: Evaluating Household Robots When Human Values Conflict
FLIPS: Instance-Fingerprinting for LLMs via Pseudo-random Sequences
Physics-Guided Policy Optimization with Self-Distillation
Safety Measurements for Fine-tuned LLMs Should be Grounded in Capability
Evaluating Transformer and LSTM Frameworks for Prediction in Ungauged Basins
ChatHealthAI: Aligning Electronic Health Record Representations with Large Language Model…
Solipsistic Superintelligence is Unlikely to be Cooperative