Translating Natural Language to Strategic Temporal Specifications via LLMs
Explorar
Noticias de IA
30934 elementos — filtrados, clasificados y sin duplicados
ADVENT: LLM-Driven Automatic Predicate Invention for ILP
ContextSniper: AntTrail's Token-Efficient Code Memory for Repository-Level Program Repair
EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments
Online Safety Monitoring for LLMs
CreativityNeuro: Steering Language Model Weights to Improve Divergent Thinking and Reduce…
Discrete Diffusion Language Models for Interactive Radiology Report Drafting
InduceKV: Fixed-Footprint Continual Adaptation of Multimodal LLMs via Inducing KV Memories
PACE: A Proxy for Agentic Capability Evaluation
Distributed Attacks in Persistent-State AI Control
Safeguarding LLM Agents from Misalignment through Provenance Analysis
Adoption and Impact of Command-Line AI Coding Agents: A Study of Microsoft's Early 2026 R…
IsoSci: A Benchmark of Isomorphic Cross-Domain Science Problems for Evaluating Reasoning …
Path-level Hindsight Instructions for Semantic Exploration in Vision-Language Navigation
SimWorlds: A Multi-Agent System for Dynamic 3D Scene Creation
Subliminal Clocks: Latent Time Modelling in Diffusion Language Models
World Feedback for Clinical Agents: Diagnosing RL in FHIR Environments
ElephantAgent: Contextual State Continuity in Agentic Systems
Don't Let Gains FADE: Breaking Down Policy Gradient Weights in RL
A$^{2}$utoLPBench: An Auto-Generated, Agent-Friendly LP Benchmark via Inverse-KKT Constru…
A rubric-based controlled comparison of frontier language models on expert-authored clini…
KernelSight-LM: A Kernel-Level LLM Inference Simulator
Algebraic Model Counting for Global Analysis of Optimal Decision Trees
Procedural Memory Distillation: Online Reflection for Self-Improving Language Models
Coding-agents can replicate scientific machine learning papers
IntentTune: Using user demand and personalization to resolve "unknown" query intents for …
The Agentic Garden of Forking Paths
Grounded Optimization: A Layered Engineering Framework for Reducing LLM Hallucination in …
A-TMA: Decoupling State-Aware Memory Failures in Long-Term Agent Memory
Criticality-Based Guard Rail Validation for AI Agent Decisions in Autonomous Telecom Netw…