CodeGolf Bench: A Multi-Language Benchmark for Evaluating Concise Code Generation Capabil…
Explorar
Noticias de IA
27413 elementos — filtrados, clasificados y sin duplicados
Hamiltonian-Inspired Attention Mechanism for Scalable RF Transmitter Fingerprinting
Sophrosyne: Agentic Exploration of Relational Data Systems Needs Moderation
Safe Equilibrium Policy Optimization for Strategic Agent Policies
FAM-Bench: A Multimodal Benchmark for Condition-Aware Food-as-Medicine Reasoning
Fine-Tuning Improves Information Conveyance in Language Models
Hide-and-Seek in Trajectories: Discovering Failure Signals for VLA Runtime Monitoring
Evolutionary Algorithm for Reservoir Learning and Yielding
Unlearning in Diffusion Models: A Unified Framework with KL Divergence and Likelihood Con…
Differentially Private Preference Data Synthesis for Large Language Model Alignment
Design and Evaluation of Multi-Agent AI Oracle Systems for Prediction Market Resolution
Updating the standard neuron model in artificial neural networks
MechVQA: Benchmarking and Enhancing Multimodal LLMs on Comprehensive Mechanical Drawing U…
FEM-Bench: A Structured Scientific Reasoning Benchmark for Evaluating Code-Generating LLMs
OpenSTBench: Beyond Semantic Evaluation for Speech Translation
On the impact of retrieved content representations in RAG Pipelines
OrcaRouter: A Production-Oriented LLM Router with Hybrid Offline-Online Learning
GSAM: A Generalizable and Safe Robotic Framework for Articulated Object Manipulation
Chatterbox-Flash: Prior-Calibrated Block Diffusion for Streaming Zero-Shot TTS
A Unified and Reproducible Experimentation Framework for Speech Understanding
Flow Equivariant World Models: Memory for Partially Observed Dynamic Environments
A Novel Global Context-aware Deep Neural Network for Enhanced Brain Tumor Segmentation us…
Industrializing Prediction-Powered Inference: The GLIDE Library for Reliable GenAI and Ag…
Seeing Before Agreeing: Aligning Multi-Agent Consensus with Visual Evidence
Simple Token-Efficient Vision-Language Model for Case-level Pathology Synoptic Report Gen…
Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO
Procedural Generation of First Person Shooter Maps using Map-Elites
Human-Alignment, Calibration, and Activation Patterns in Large Language Model Uncertainty
Same Patient, Different Words, Different Diagnosis? Evaluating Semantic Stability in Clin…
LARK: Learnability-Grounded Trajectory Selection for Efficient Reasoning Distillation