Learning Symbolic Constraint Representations from Examples: A Neuro-Symbolic Approach
Browse
AI News
37834 items — filtered, classified, deduplicated
T-GADE: Thermodynamical Generative-AI-Driven Evolution of LLM Artifacts
SoK: Rethinking Jailbreaking in the Era of Agentic AI: Attacks, Defenses, and Practical C…
CMA-OT: Hierarchical Expert Supervision for Dance-to-Music Generation
DropVLA: An Action-Level Backdoor Attack on Vision-Language-Action Models
Beyond ID Embeddings: Process-Grounded Language Modeling for Cognitive Diagnosis
Online Video Agent Harness for Long Video Understanding
LLM Compression by Block Removal with Constrained Binary Optimization
Can LLMs in Draft-Verify-Revise Pipelines Resolve Deictic Ambiguity?
GLARE: Generative Learning via Adversarial Reward Estimation For Social Dynamics Forecast…
RunningTensor: Generalizing Linear Attention to Higher-Order Recurrent States
Measuring Pragmatic Influence in Large Language Model Instructions
Skill Issue: Lessons from Optimizing Repository SKILLs for Coding Agents
WinSyn: An Automated Pipeline for Realistic Enterprise Question-Answering Evaluation
Pelican-Sim 1.0: A General World Model Simulator for Embodied Intelligence
SCOPE-OPSD: Fisher-Conditioned Privileged Subspaces for On-Policy Self-Distillation
ResoSeg: Resonance Tagger using Transformer and Segment Model
Harness or Model? Isolating the Harness Effect in Agentic Coding with a Contamination-Con…
Who Pays for Open Review? Visible Author Reputation and Its Effect on Ratings
How Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and…
Hierarchical Prototype Emergence in Modern Hopfield Models
Calibrated Ambiguity in Multimodal Language Models: Humans reach for cultural references,…
DU-NO: A Parameter-Efficient Double U-Shaped Neural Operator for Phase-Resolving Wave Mod…
AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training
What Drives Recovery in Agentic Text-to-Cypher? LAST-CQ: An LLM Agent Self-Refinement Fra…
Reinforcement Learning over Patient Trajectories for Clinical Reasoning in EHR Foundation…
A Graph-Based Approach for Mapping Kernel-Level Telemetry to MITRE ATT&CK
When Rubrics Fail: Hallucinations Reveal Blind Spots in Medical AI Evaluation
Countdown-Code: A Testbed for Studying The Emergence and Generalization of Reward Hacking…
Beyond Generation and Accuracy: Diagnosing and Enhancing Visual Chain-of-Thought for Geom…