Soft Guidance Starts to Outperform CoT Prompting as LLMs Improve
Explorar
Noticias de IA
21272 elementos — filtrados, clasificados y sin duplicados
Distractor-Aware Truncation: Disentangling Context-Length Effects from Signal Loss in Lon…
A Theory of Conditional Collapse under Low-Rank Weight-Space Ablations: I. The Single-Blo…
OR-Agent: Bridging Evolutionary Search and Structured Research for Automated Algorithm Di…
FlowForm: Synergizing Fluid Physics with Topological Consistency for Satellite Flood Synt…
GENESIS: Towards Explainable Causal Discovery
Logic Before Language: Pre-pretraining on Formal Derivations Fosters Skill Acquisition an…
Learning Molecular Representations from Cellular Phenotypes with Structure Preservation
OliveGemma: A 3 Billion Visual Language Model for Recognising the Mediterranean & Europea…
AgentPanel: Toward a New Paradigm for Human--AI Collaboration in Exploring Scientific Que…
Evaluating LLM Trade-offs for Enterprise Automation: Lessons from Workflow Generation in …
Evaluating LLMs in Database Scenarios: A Lifecycle Benchmark for Assessing Their Potentia…
Beyond Representational Similarity: Source-Conditioned Description-Length Gain for Genera…
TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning
FACTWASH: Catching AI Rewrites That Wash Hearsay into Fact
Multi-Task Multi-Frame Visual Piano Transcription
When and Where to Look: Adaptive Visual Evidence Scheduling for Efficient Long Video Unde…
Equivariant Music Transformer
How Many Labels Are Enough? ALDA: Active Learning Deployment Advisor for Medical Image Cl…
Pin Once, Swap Light: Subspace-Aligned Centroid-Residual Training for Efficient Ultra-LoR…
TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning
Behaviorally Adaptive Visual Diversion for Inclusive and Resilient Digital Assessment Del…
Decoupling Generation and Selection for Budget-Constrained Faithful Summarization
Self-Organising Digital Circuits
Improving Reproducibility in Evaluation through Multi-Level Annotator Modeling
Assessing speech quality metrics for evaluation of neural audio codecs under clean speech…
KnowHal: A Knowledge-Driven Benchmark for Comprehensive Multimodal Hallucination Evaluati…
When Policies Change Probabilities: Modular Decision-Making for LLM Code Review
ChiEngMixBench: Evaluating Large Language Models on Expert-Style Chinese-English Terminol…
PASE: Leveraging the Phonological Prior of WavLM for Low-Hallucination Generative Speech …