Phantom transitions in language model fine-tuning
Explorar
Noticias de IA
22114 elementos — filtrados, clasificados y sin duplicados
From Rigid to Dynamic: Entropy-Guided Adaptive Inference for Long-Context LLMs
Page image classifier fine-tuned on century-spanning archives of scanned documents for fu…
Selecting New Measurement Locations to Diversify Traffic-Pattern Coverage: A Real-World E…
Self-Explainability in Self-Adaptive and Self-Organising Systems: Status and Research Dir…
Symbolic Reasoning Frameworks Modulate LLM Risk Aversion in Multi-Agent Strategic Settings
Offline Reinforcement Learning for Plasma Control in Nuclear Fusion: Codebase and Benchma…
SENTRY: Statistical Reliability Analysis of Vision Transformers Under Soft Errors
Evaluating Advanced Prompting on Gemini Flash for Multi-Hop Biomedical QA
Liberating LLM Capabilities in Full-Duplex Speech Models
Beyond Item IDs: Scaling Short-Form-Video Recommendation via Semantic-Native Long Sequenc…
AI-Integrated Learning Management System for Middle School: A Longitudinal Study of Learn…
DIYHealth Suite: Dataset, Model, and Benchmark for Health Management at Home
Multimodal Large Language Models as Synthetic Participants in Video-Based Studies: An Eva…
Bidirectional Semantic Complementary Tool Retrieval for Remote Sensing Agents
Concerns and Strategic Responses of Older Workers Navigating Generative AI in Bridge Empl…
Bridging Traditional Explainability Methods and Multimodal Multilingual Models: An XAI-Ba…
MedicalRec: Medical recommender system for image classification without retraining
Cost-Aware Speculative Execution for LLM-Agent Workflows: An Integrated Five-Dimension Me…
Comparative evaluation of training strategies using partially labelled datasets for segme…
SIFT: Selective-Index For Fast Compute of RAG Prefill by Exploiting Attention Invariance
WeaveBench: A Long-Horizon, Real-World Benchmark for Computer-Use Agents with Hybrid Inte…
Capacity, Not Format: Rethinking Structured Reasoning Failures
Correct Looks Better: Pairwise Comparisons Reveal Accuracy Rankings
RunAgent SuperBrowser: A Theory of Autonomous Web Navigation Grounded in Human Browsing B…
Experience Makes Skillful: Enabling Generalizable Medical Agent Reasoning via Self-Evolvi…
TRL-Bench: Standardizing Cross-Paradigm Representation-Level Evaluation of Tabular Encode…
MASS: Deep Research for Social Sciences with Memory-Augmented Social Simulation
Reliable to Expressive: A Curriculum for Rubric-Following Safety Judges
Enabling KV Caching of Shared Prefix for Diffusion Language Models