Source-Free MT Evaluation Is Not MT Evaluation
Explorar
Noticias de IA
27413 elementos — filtrados, clasificados y sin duplicados
BC-Bench: Evaluating Agentic Engineering in a Domain-Specific Language for ERP
WA-JEPA: Rethinking the Video JEPA Paradigm for World-Action Modeling in Autonomous Drivi…
Explainable Deepfake Detection with Feature-robust Augmentation and Evidence-grounded Exp…
Advantage-level Aggregation Reinforcement Learning for X-point Target Magnetic Configurat…
STAR-OPD: Structured Aspect-Cascade-Aware On-Policy Reward Distillation for ABSA Quadrupl…
Structured but Fragile: On the Limits of LLMs in Cybersecurity Decision-Making
Vibe Coding and Web Application Security: A Twin-Prompt Study
When Generated Images Look Right and Retrieve Wrong: Coverage-Guided Cross-Scale Re-Index…
Denoising the Future: Context-Aware Spectral Diffusion for Temporal Knowledge Graph Extra…
Extractive Summarization for Arabic Documents Using SAraBERT with a Semantic Siamese Simi…
Identity-Aware Human-Object Interaction Motion Captioning
CARD: Diagnosing Belief to Action Routing Failures in Vision Language Models
Provable Edge-of-Stability for Adam on a One-Dimensional Quadratic
C-Score: Beyond Accuracy for Robustness Assessment in Semi-Supervised Learning under Open…
RiskTraf: Risk-Extrapolated Residual Learning for Multi-Variate Traffic Flow Prediction
PSK at WMT 2026 MIST: Task-Specialized QLoRA Adapters for Multilingual Summarization and …
Temporal Validity on Real Software Histories: Eliminating Stale-Fact Errors in Code-Assis…
Do SpeechLMs Hear Their Own Opinions? Diagnosing and Mitigating Previous-Belief Contamina…
Free-Text Evaluation of LLMs for 5G Domain Knowledge and Fault Analysis using LLM-as-Judge
AT-ViT: Area-Targeted Multi-View Vision Transformer with Cross-Attention and Multi-Scale …
CertVLA: Certified Defense against Physical Visual Attacks for Vision-Language-Action Mod…
JuryProbe: An Empirical Consensus-Risk Diagnostic for Routing Reference-Free Factuality J…
When Failures Propagate: Causal Failure Attribution in Agentic Retrieval-Augmented Genera…
Testing and Evaluation of Agentic AI Systems In Military Command and Control
Large Scale AI Grading of Handwritten Physics Assessments: Score Agreement and Olympiad T…
Beyond End-to-End Success: Diagnosing Failures in Long-Horizon Security LLM Agents
Towards Traffic Modelling of Multi-Agent Systems: The Role of Coordination Topology
One Hierarchy, Two Systems: Semantic Product IDs for Discovery-Surface Ranking and Search…
Consistency Models for Fast MRI Reconstruction Using Regularization by Denoising