TRACE Bench: Task-driven Roleplay Agentic Checklist Evaluation
Explorar
Noticias de IA
21010 elementos — filtrados, clasificados y sin duplicados
Ethics Practices in AI Development: An Empirical Study Across Roles and Regions
HCGRec: Hint-Conditioned Generative Recommendation with Semantic IDs
From Prompting to Behavioral Alignment: Personalized LLM Judges for Recommendation Evalua…
Deep Learning Based Relative Transfer Matrix Estimation for Multiple Sources and Multiple…
GUIDE: Governed Unified Intelligence for Document-to-Artifact Generation in Enterprise Se…
DORA Explorer: Improving the Exploration Ability of LLMs Without Training
Program Semantic Inequivalence Game with Large Language Models
RoadWeaver: Large-Scale Lane-Level HD Map Generation from Scratch for Autonomous Driving …
How to Spend Your Oracle Budget: Practical Guidance for Protein Structure Prediction Mode…
ReXrank: A Public Leaderboard for AI-Powered Radiology Report Generation
Can Frontier LLMs Match Natively Multimodal Embeddings? A Comparison on Hard-Negative Tex…
AI Guardrail Survival under Single-Cycle Agentic Self-Summarization
VLM2Rec: Resolving Modality Collapse in Vision-Language Model Embedders for Multimodal Se…
Representation Finetuning for Continual Learning
Post-Training with Policy Gradients: Optimality and the Base Model Barrier
REVERE: Reflective Evolving Research Engineer
Forecasting Side Effects of Activation Steering
CoAdapt-GUI: Joint Workflow Context and Policy Adaptation for Unseen GUI Applications
Cavity-Enhanced Collective Quantum Processing with Polarization-Encoded Qubits
From Synthesis to Removal: Physics-Grounded Reflection Simulation and Diffusion-Based Vid…
Social Meaning in Large Language Models: Structure, Magnitude, and Pragmatic Prompting
VQ-bench: A Composable Vector Quantization Framework
Claim-Level Reliability Assessment for Efficient Test-Time Reasoning
Credo: Declarative Control of LLM Pipelines via Beliefs and Policies
HexEval: An Evidence-Driven Hexagonal Framework for Multidimensional Scholar Assessment
Uncertainty as a Planning Signal: Multi-Turn Decision Making for Goal-Oriented Conversati…
OpenAg: Democratizing Agricultural Intelligence
BEST-KAG: Enhancing Question Answering of Building Engineering Standards with Multimodal …
Localizing Safety Alignment: MLP Layers and Mid-Network Blocks Encode Refusal Behavior in…