Efficient Benchmarking Is Just Feature Selection and Multiple Regression
Explorar
Noticias de IA
21227 elementos — filtrados, clasificados y sin duplicados
Benchmarking the Limits of In-Context Reinforcement Learning for Ad-Hoc Teamwork
TIGER: Text-Informed Generalized Enzyme-Reaction Retrieval
DemoEvolve: Overcoming Sparse Feedback in Agentic Harness Evolution with Demonstrations
Summoning the Oracle to Slay It: Mitigating Look-Ahead Bias in Financial Backtesting with…
Agent-as-Peer-Debriefer: A Multi-Agent Framework with Perspective-Based Refinement for Qu…
Retrying vs Resampling in AI Control
From Model Scaling to System Scaling: Scaling the Harness in Agentic AI
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
Beyond Predefined Learning Objects: A Thinking-Learning Interaction Model for Up-to-Date …
FG-CLIP 2: A Bilingual Fine-grained Vision-Language Alignment Model
Red-Teaming Claude Opus and ChatGPT-based Security Advisors for Trusted Execution Environ…
CARL-CXR: Continual Adapter-Based Routing for Task-Unknown Chest Radiograph Classification
MoBiQuant: Mixture-of-Bits Quantization for Token-Adaptive Any-Precision LLM
Smart Timing for Mining: A Deep Learning Framework for Bitcoin Hardware ROI Prediction
Non-Invasive Reconstruction of Intracranial EEG Across the Deep Temporal Lobe from Scalp …
MultiPUFFIN: A Multimodal Domain-Constrained Foundation Model for Molecular Property Pred…
Topology-Driven Transferability Estimation of Medical Foundation Models for Segmentation
Learning from Trials and Errors: Reflective Test-Time Planning for Embodied LLMs
Intrinsically Interpretable Attention via Sparse Post-Training
LETS Forecast: Learning Embedology for Time Series Forecasting
Document Classification Pattern Recognition via Information Fusion: A Systematic Review o…
Agent-Facing Information Design in LLM Tool Registries
When Mean CE Fails: Median CE Can Better Track Language Model Quality
Fundamental Limitation in Explaining AI
GRAIL: AI translation for scientists application workflow on satellite data
Agent Manufacturing: Foundation-Model Agents as First-Class Industrial Entities
TaBIIC2: Interactive Building of Ontological Taxonomies using Weighted Self-Organizing Ma…
Extracting Training Data from Diffusion Language Models via Infilling
Intent Signal Theory: A Computational Framework for Intent-State Control in Human-AI Inte…