Can Training Logs Make Model Comparisons More Precise?
Explorar
Noticias de IA
29387 elementos — filtrados, clasificados y sin duplicados
DigitCode: Symbolic Tokenization of Hand Motion by Anatomical Units
PASE: Leveraging the Phonological Prior of WavLM for Low-Hallucination Generative Speech …
A Blind Spot in Alignment: Quantifying Biosecurity Risks in Large Language Models
$S^3$: Improving Agent Safety through Multi-Stage Defense
Multi-Camera Trajectory Forecasting with Trajectory Tensors
KnowHal: A Knowledge-Driven Benchmark for Comprehensive Multimodal Hallucination Evaluati…
StuPASE: Towards Low-Hallucination Studio-Quality Generative Speech Enhancement
Implementing Causal Perception: Competing SCMs and Situated Fairness
Learning Molecular Representations from Cellular Phenotypes with Structure Preservation
ContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities?
When Policies Change Probabilities: Modular Decision-Making for LLM Code Review
Less Traffic, Better Outcomes: Competition-Aware Request Dispatch in Real-Time Ad Exchang…
When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models
Taming the Implicit: Dual-Channel Risk-Aware Reinforcement Fine-Tuning for Continual Mult…
Is Inter-Seed Cross-Play Enough? Evaluating the Robustness of Zero-Shot Coordination Algo…
When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation
Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Fre…
UniGD: A Unified Generative-Discriminative Framework for Industrial Retrieval
Policy Fragmentation or Institutional Alignment? Institutional Governance of AI in Univer…
HyperAgent: Planning and Acting over Tool-Schema Hypergraphs for Tool-Use LLM Agents
Large language models for partial differential equation workflows
Learning Clinical-Trial Strategy: Offline Policy Training for Decision Agents
Diversity is Not Ambiguity: Toward Accurate and Efficient Ambiguity Detection for Open-Do…
Learning a Vector-Symbolic Model for Socio-Cultural Tasks
One Knob to Rule Them All: A Unified Optimal Transport View of Cold-Start Active Learning
Minimax-Optimal Semiparametric Contextual Dynamic Pricing with Multimodal Revenue
When Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Rea…
Hybrid LLM-Augmented Reinforcement Learning Agents for Complex Sequential Decision Tasks
Structure-Aware Robust Fine-Tuning: Defending Vision-Language-Action Robots Against Physi…