{"total_count":1620,"offset":0,"limit":100,"data":[{"id":"sbd4zwzmdd60bne1246jbjh9","name":"durable-notebook","description":"Multi-turn RL environment where facts are compacted out of context, forcing filesystem persistence; naive (hackable) and hardened graders for study...","visibility":"PUBLIC","owner":{"type":"user","name":"aravind-k"},"created_at":"2026-09-06T04:04:36.612000","updated_at":"2026-09-06T04:17:17.166000","tags":["rl","reward-hacking","memory","agentic","train"],"stars":1,"latest_ci_status":null,"latest_version":"0.1.3"},{"id":"zrgps1pueanptl9qih0d5r6f","name":"fleet-lock","description":"fleet-lock — implement the coordination registry N agents share on one working tree: path claims with glob overlap, and a deploy lock where EXPIRED...","visibility":"PUBLIC","owner":{"type":"user","name":"perfectworld"},"created_at":"2026-09-06T02:06:54.429000","updated_at":"2026-09-06T02:06:57.762000","tags":[],"stars":0,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"nsy53yuru2t7nt04elgr4uc7","name":"secret-redaction","description":"secret-redaction — write a redactor that removes credentials from developer text without corrupting the code around them (two-sided reward).","visibility":"PUBLIC","owner":{"type":"user","name":"perfectworld"},"created_at":"2026-09-06T02:06:36.871000","updated_at":"2026-09-06T02:06:39.790000","tags":[],"stars":0,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"psbm4uyznhmkrepoawert7qn","name":"scaling-book","description":"Train and evaluate systems reasoning from How To Scale Your Model.","visibility":"PUBLIC","owner":{"type":"user","name":"jahnclawdmonet"},"created_at":"2026-09-05T12:00:58.955000","updated_at":"2026-09-05T12:01:03.428000","tags":["eval","train"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"ivhgnhfjl3q4benmxj4ushh5","name":"redtape","description":"Does the agent know when a required fact is missing? Verifiable abstention scored against PolicyEngine, no LLM judge.","visibility":"PUBLIC","owner":{"type":"team","name":"jakpotvin"},"created_at":"2026-09-05T02:37:44.737000","updated_at":"2026-09-05T02:37:47.756000","tags":["single-turn","v1","eval","abstention","calibration","public-benefits"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"an8yuvmg6kw539bkx9jk49b1","name":"uber-clone-031","description":"Single-task Android APK evaluation: verified Premium card ride from Airport Road to City Centre.","visibility":"PUBLIC","owner":{"type":"user","name":"terrano09"},"created_at":"2026-09-04T13:14:39.916000","updated_at":"2026-09-05T11:21:40.749000","tags":["mobile","android","apk","ride","single-task","eval"],"stars":0,"latest_ci_status":null,"latest_version":"0.3.0"},{"id":"ys2bw41700n5umraylt1umk2","name":"triviaqa","description":"TriviaQA open-domain trivia QA evaluation environment with official exact-match scoring over the full answer-alias set","visibility":"PUBLIC","owner":{"type":"user","name":"ux-xd"},"created_at":"2026-09-04T12:15:10.957000","updated_at":"2026-09-04T12:15:13.873000","tags":["trivia","qa","single-turn","benchmark","eval"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"mej2zk5dpesno2uia56e6al1","name":"bugfix-agent-env","description":"RLVR coding environment for training and evaluating LLM agents on automated code-fixing tasks.","visibility":"PUBLIC","owner":{"type":"user","name":"siddikeshwer"},"created_at":"2026-09-04T10:20:11.663000","updated_at":"2026-09-04T10:22:24.326000","tags":["placeholder-tag","train","eval"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"rb2fkmilxef2gc3bkvrheat3","name":"break-the-grader","description":"Break the grader, or prove it cannot be broken — adversarial submissions minted from exact certificates, no answer key anywhere, and rungs where re...","visibility":"PUBLIC","owner":{"type":"user","name":"carlos-toledo"},"created_at":"2026-09-04T04:27:13.380000","updated_at":"2026-09-04T04:31:46.630000","tags":["eval","train","single-turn","reward-hacking","verifier-soundness","math","exact-arithmetic","synthetic","procedural","v1"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.2"},{"id":"sehcf8wo658k1ebja56fpqzu","name":"audio-signal-processing-noise-reduction","description":"Comprehensive environment for evaluating LLM knowledge of digital audio signal processing, noise reduction techniques, spectral analysis, adaptive ...","visibility":"PUBLIC","owner":{"type":"user","name":"margar"},"created_at":"2026-09-04T02:47:24.488000","updated_at":"2026-09-04T03:09:16.670000","tags":["audio","signal-processing","noise-reduction","dsp","fft","filtering","acoustics","psychoacoustics","wavelets","adaptive-filtering"],"stars":1,"latest_ci_status":null,"latest_version":"1.0.3"},{"id":"spfss1sepe2cndc88mwkusg2","name":"objective-conflict-refund-desk","description":"A support agent given a real performance objective (resolution rate, handle time - escalations count against it) AND a $50 refund cap it must not e...","visibility":"PUBLIC","owner":{"type":"user","name":"antbuilds"},"created_at":"2026-09-04T01:59:33.929000","updated_at":"2026-09-04T02:08:52.257000","tags":["multi-turn","adversarial","goal-conflict","reward-hacking","indirect-prompt-injection","tool-use","agent-security","safety","train","eval"],"stars":0,"latest_ci_status":null,"latest_version":"0.2.0"},{"id":"mgncg9n1yzcacs1s60vdtfya","name":"tool-poisoned-refund-desk","description":"Multi-turn indirect-injection environment: a support agent with a $50 refund cap and real tools (lookup_order, check_approval, issue_refund, escala...","visibility":"PUBLIC","owner":{"type":"user","name":"antbuilds"},"created_at":"2026-09-04T01:59:07.546000","updated_at":"2026-09-04T01:59:11.006000","tags":["multi-turn","adversarial","indirect-prompt-injection","tool-use","agent-security","safety","train","eval"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"fg5jkw9gamyb54znbk73znia","name":"policy-override-mailroom","description":"Multi-turn adversarial train + eval: a support agent with a $50 refund cap vs a scripted customer that ramps pressure over several turns (plead, fa...","visibility":"PUBLIC","owner":{"type":"user","name":"antbuilds"},"created_at":"2026-09-04T01:20:06.588000","updated_at":"2026-09-04T01:20:09.092000","tags":["multi-turn","adversarial","prompt-injection","social-engineering","safety","agent-security","train","eval"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"rn5mwe0fbinyvwnux3zhxt9p","name":"prompt-injection-refund-desk","description":"Adversarial train + eval: a support agent with a $50 refund cap, attacked by prompt-injection payloads hidden in tickets. Procedural generator for ...","visibility":"PUBLIC","owner":{"type":"user","name":"antbuilds"},"created_at":"2026-09-04T01:16:25.018000","updated_at":"2026-09-04T01:16:27.917000","tags":["single-turn","adversarial","prompt-injection","safety","agent-security","train","eval"],"stars":0,"latest_ci_status":null,"latest_version":"0.2.0"},{"id":"e6iy3c5sh0pjddcg5rzh6nwd","name":"geospatial-path-planning","description":"GIS-based geospatial path planning environment evaluating LLM reasoning over terrain-aware routing, obstacle avoidance, multi-objective optimizatio...","visibility":"PUBLIC","owner":{"type":"user","name":"evely"},"created_at":"2026-09-03T14:09:06.152000","updated_at":"2026-09-03T14:09:15.246000","tags":["geospatial","path-planning","gis","routing","spatial-reasoning","multi-objective","terrain","algorithms"],"stars":0,"latest_ci_status":null,"latest_version":"1.0.0"},{"id":"nfk2rhd7i1oxuegumhp0xbpm","name":"long-horizon-medical-agent-benchmark-vet-clinic-ops","description":"Long-Horizon Medical Agent Benchmark (Veterinary Clinic Ops) by Praesidium Compliance Systems -- praesidiumsystems.ai. 100-task, long-horizon agent...","visibility":"PUBLIC","owner":{"type":"team","name":"praesidiumsystems"},"created_at":"2026-09-03T07:10:39.639000","updated_at":"2026-09-03T19:08:29.493000","tags":["tool-use","database","multi-turn","tool-env","train","eval","benchmark","easy","medium","hard"],"stars":8,"latest_ci_status":null,"latest_version":"1.0.3"},{"id":"nt42yji44dzbd2lsumtmunyl","name":"openadapt-mockmed-extradup","description":"Reward for a synthetic EMR write, certified on the synthetic MockMed/ExtraDup corpus only: 1.0 when a tier-2 read of the system of record shows the...","visibility":"PUBLIC","owner":{"type":"team","name":"openadapt"},"created_at":"2026-09-02T15:32:05.119000","updated_at":"2026-09-02T15:32:08.355000","tags":["single-turn","agent","verification","reward-hacking","healthcare","synthetic","eval","train"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"u5qafpvawjyfyzypfkvyx4f1","name":"crypto-protocol-analyzer","description":"Cryptography Protocol Analyzer: RL environment for evaluating LLM ability to analyze, attack, and reason about toy cipher systems including Caesar,...","visibility":"PUBLIC","owner":{"type":"user","name":"melis"},"created_at":"2026-09-02T14:29:19.651000","updated_at":"2026-09-02T14:30:34.135000","tags":["cryptography","cipher","security","protocol-analysis","frequency-analysis","classical-ciphers","cryptanalysis"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"ilb9vbuu2mnh81c5tsxl704o","name":"techtree-v02-conformance","description":"Deterministic infrastructure-conformance environment for Techtree v0.2","visibility":"PUBLIC","owner":{"type":"team","name":"techtree"},"created_at":"2026-09-01T21:13:40.850000","updated_at":"2026-09-01T21:13:45.148000","tags":[],"stars":0,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"k0o9w9oep5bfanenmk918k7z","name":"bayesian-inference-probprog","description":"Comprehensive evaluation of Bayesian inference theory, probabilistic programming practice, and applied statistical modeling across MCMC, variationa...","visibility":"PUBLIC","owner":{"type":"user","name":"janni"},"created_at":"2026-09-01T15:40:41.979000","updated_at":"2026-09-01T15:41:31.575000","tags":["bayesian","probabilistic-programming","statistics","mcmc","variational-inference","hierarchical-models","gaussian-processes","pymc","pyro","stan"],"stars":0,"latest_ci_status":null,"latest_version":"1.0.1"},{"id":"fv9m1f3tke0b41xmofm5lqfn","name":"beancount-ledger","description":"Bank reconciliation and month-end close on a Beancount ledger, scored deterministically","visibility":"PUBLIC","owner":{"type":"user","name":"cangultekn"},"created_at":"2026-09-01T11:11:46.906000","updated_at":"2026-09-01T11:30:31.210000","tags":["accounting","tool-use","multi-turn","train","eval"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"zbbn7t1e19agd21nq07z801n","name":"event-recon","description":"Multi-system event reconciliation: find and fix why two production systems disagree about money. 120 procedurally generated forensic-accounting tas...","visibility":"PUBLIC","owner":{"type":"user","name":"briahnloo"},"created_at":"2026-09-01T03:41:58.254000","updated_at":"2026-09-01T03:42:01.521000","tags":["reconciliation","forensic-accounting","sql","agentic","tool-use","data-integrity","debugging","verifiable-rewards","procedural-generation","long-horizon"],"stars":0,"latest_ci_status":null,"latest_version":"1.0.0"},{"id":"m8dds28czl4mr4kdytn87x69","name":"mcp-sqlite","description":"Answer questions about a messy SQLite database through an MCP server.","visibility":"PUBLIC","owner":{"type":"user","name":"mikqu"},"created_at":"2026-08-31T12:10:00.457000","updated_at":"2026-08-31T12:22:38.545000","tags":["sql","sqlite","mcp","tool-use","database","agentic","multi-turn","llm-judge","schema-reasoning"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"khwh8t4vyk8ggw2da4xptgiz","name":"rl-hyperparameter-tuner","description":"Reinforcement Learning Hyperparameter Tuner: evaluate LLM ability to recommend optimal RL hyperparameters across algorithms, environments, and trai...","visibility":"PUBLIC","owner":{"type":"user","name":"kimberly"},"created_at":"2026-08-31T03:54:50.573000","updated_at":"2026-08-31T03:56:07.252000","tags":["reinforcement-learning","hyperparameter-tuning","rl","optimization","ppo","sac","dqn"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"dgf2tnj6jt1a51wfwy19t10z","name":"ironclad","description":"A deterministic RL environment for verifiable IaC security remediation, graded by a layered oracle.","visibility":"PUBLIC","owner":{"type":"user","name":"vinay-k-rajith"},"created_at":"2026-08-31T03:24:06.751000","updated_at":"2026-08-31T03:27:02.770000","tags":["multi-turn","tool-use","security","infrastructure-as-code","terraform","train","eval"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.1"},{"id":"qzraoo3op5v15bkaworuasnd","name":"nas-toy-env","description":"Neural Architecture Search Toy Environment - RL environment for training LLMs to design optimal neural network architectures via structured search ...","visibility":"PUBLIC","owner":{"type":"user","name":"george"},"created_at":"2026-08-30T13:57:04.816000","updated_at":"2026-08-30T13:58:03.016000","tags":["neural-architecture-search","nas","architecture-design","deep-learning","meta-learning","toy-environment","rl"],"stars":0,"latest_ci_status":null,"latest_version":"1.1.1"},{"id":"og88r43a1w4029esuj3u02ro","name":"genetic-algorithm-evolution-simulator","description":"Evaluate LLM reasoning on genetic algorithm design, fitness landscapes, selection strategies, crossover operators, convergence analysis, and multi-...","visibility":"PUBLIC","owner":{"type":"user","name":"annie"},"created_at":"2026-08-30T13:42:37.424000","updated_at":"2026-08-30T13:43:23.779000","tags":["genetic-algorithm","evolutionary-computation","optimization","metaheuristics","fitness-landscape"],"stars":0,"latest_ci_status":null,"latest_version":"1.1.0"},{"id":"tms6t54zk32w16btw47by8cb","name":"captionsmith","description":"Deterministic SRT captioning environment for LLM evaluation and reinforcement learning.","visibility":"PUBLIC","owner":{"type":"user","name":"thesatvik"},"created_at":"2026-08-30T09:55:44.965000","updated_at":"2026-08-30T10:35:03.609000","tags":["single-turn","structured-output","captions","eval","train","rlvr"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.1"},{"id":"k3bheeag45mbjtcponyt3cq1","name":"csat-gamer-env","description":"Reward hacking RL environment targeting CSAT metric manipulation.","visibility":"PUBLIC","owner":{"type":"user","name":"shamshad7"},"created_at":"2026-08-30T05:19:58.418000","updated_at":"2026-08-30T05:23:16.267000","tags":[],"stars":0,"latest_ci_status":null,"latest_version":"0.1.1"},{"id":"tbeluzn9zza0wdy6ypl3lsti","name":"cellular-automata-designer","description":"Cellular Automata and Conway's Game of Life Designer environment for evaluating pattern design, rule implementation, and automata analysis capabili...","visibility":"PUBLIC","owner":{"type":"user","name":"sandrab"},"created_at":"2026-08-30T02:35:36.463000","updated_at":"2026-08-30T02:37:50.856000","tags":["cellular-automata","game-of-life","pattern-design","simulation","mathematics"],"stars":0,"latest_ci_status":null,"latest_version":"0.0.0"},{"id":"oljvfcmb25kp3vohb5xbjtka","name":"accessibility-auditor","description":"Evaluate LLM ability to audit web and app accessibility for disabilities: WCAG compliance, screen reader support, keyboard navigation, color contra...","visibility":"PUBLIC","owner":{"type":"user","name":"lioneo"},"created_at":"2026-08-30T02:16:16.107000","updated_at":"2026-08-30T02:17:44.253000","tags":["accessibility","wcag","a11y","web-usability","disability","screen-reader","aria","inclusive-design"],"stars":1,"latest_ci_status":null,"latest_version":"0.0.1"},{"id":"g6kdb4ak7dcra1676gsqei8d","name":"selective-verification-v1","description":"Reward calibrated abstention on visual claim verification with a strictly proper scoring rule.","visibility":"PUBLIC","owner":{"type":"user","name":"kunaltilaganji"},"created_at":"2026-08-29T14:46:09.618000","updated_at":"2026-09-03T05:16:26.325000","tags":["calibration","uncertainty","abstention","selective-prediction","vlm","verification","proper-scoring-rule","hallucination"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.5"},{"id":"qpaqto4q8vzgxbv6xdfqrqx9","name":"event-planning-vendor-coordination","description":"Verifiers environment evaluating LLM capabilities in event planning, vendor coordination, budget management, timeline scheduling, and stakeholder c...","visibility":"PUBLIC","owner":{"type":"user","name":"frank"},"created_at":"2026-08-29T13:26:52.565000","updated_at":"2026-08-29T13:27:03.910000","tags":["event-planning","vendor-coordination","budget-management","logistics","stakeholder-communication","multi-turn","planning","project-management"],"stars":1,"latest_ci_status":null,"latest_version":"1.0.0"},{"id":"cpyuf7852xlcntx0ehy1kz2u","name":"supply-chain-disruption-response-agent","description":"Evaluate LLM ability to analyze supply chain disruptions, assess impact severity, propose mitigation strategies, prioritize actions under time pres...","visibility":"PUBLIC","owner":{"type":"user","name":"patric"},"created_at":"2026-08-29T13:07:09.901000","updated_at":"2026-08-29T13:08:15","tags":["supply-chain","logistics","disruption-response","risk-management","agent","multi-turn"],"stars":0,"latest_ci_status":null,"latest_version":"5.88.97"},{"id":"h82e489yyqkc7iaq2ypfmwoa","name":"mbpp-sandboxed","description":"MBPP code-execution environment with Docker-sandboxed test running\n\nhttps://github.com/Mohammed-Shamshad/mbpp-sandboxed","visibility":"PUBLIC","owner":{"type":"user","name":"shamshad7"},"created_at":"2026-08-29T07:03:45.176000","updated_at":"2026-08-29T07:54:38.134000","tags":["coding","train","eval"],"stars":1,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"fgcq430eiwgiz33nj3vu8c9t","name":"podcast-script-fact-checker","description":"Evaluates LLM ability to generate structured podcast/video scripts with accurate facts, proper citations, and engaging delivery. Tests script struc...","visibility":"PUBLIC","owner":{"type":"user","name":"votanphat"},"created_at":"2026-08-29T05:41:21.717000","updated_at":"2026-08-29T05:41:43.497000","tags":["podcast","video-script","fact-checking","content-generation","journalism","media","accuracy"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"zuva7ciedukmtxrguezyi5pw","name":"if-rlvr","description":"Verifiable instruction following (IF-RLVR): allenai/IF_multi_constraints_upto5 prompts scored with the official IFEvalG constraint checkers - fract...","visibility":"PUBLIC","owner":{"type":"user","name":"hugoabonizio"},"created_at":"2026-08-28T16:47:00.684000","updated_at":"2026-08-28T17:18:11.158000","tags":["instruction-following","verifiable-rewards","single-turn","multilingual","train","eval"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.3"},{"id":"rn0y5jeg30c0id0z7xjt9y7a","name":"pkb-second-brain","description":"Evaluate LLM ability to design, organize, and query Personal Knowledge Base / Second Brain systems using Zettelkasten, PARA, and progressive summar...","visibility":"PUBLIC","owner":{"type":"user","name":"soundsem"},"created_at":"2026-08-28T13:26:07.276000","updated_at":"2026-08-28T13:36:33.627000","tags":["knowledge-management","second-brain","zettelkasten","para-method","note-organization","information-retrieval","summarization","productivity"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.1"},{"id":"zma3yilhltrov1q3jqw0mx3l","name":"real-estate-listing-analyzer","description":"Real-estate listing analysis, buyer-seller matching, comparative evaluation, and negotiation strategy environment for LLM reasoning assessment","visibility":"PUBLIC","owner":{"type":"user","name":"rubythao"},"created_at":"2026-08-28T12:56:18.017000","updated_at":"2026-08-28T12:57:47.459000","tags":["real-estate","analysis","matching","reasoning","domain-expertise"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"xcchlxpxyvg771v8fm9fvqz8","name":"html-extraction","description":"html-extraction — extract structured data from product pages with realistic markup defects; deterministic, no code execution.","visibility":"PUBLIC","owner":{"type":"team","name":"nike47"},"created_at":"2026-08-28T10:37:00.497000","updated_at":"2026-08-28T13:06:59.243000","tags":["html","web-scraping","information-extraction","structured-output","parsing","single-turn","deterministic","eval"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.1"},{"id":"sva3lh293917bfh4jqph7eqh","name":"ecommerce-return-refund-processor","description":"Evaluates LLM ability to process e-commerce return and refund requests with policy compliance, decision accuracy, and structured output across 40 d...","visibility":"PUBLIC","owner":{"type":"user","name":"joshhua"},"created_at":"2026-08-28T10:04:42.532000","updated_at":"2026-08-28T10:06:36.228000","tags":["e-commerce","refund","return-processing","policy-compliance","structured-output","customer-service","retail"],"stars":0,"latest_ci_status":null,"latest_version":"1.0.0"},{"id":"nzpu5gbqhae9s7exwxm3f3k5","name":"hospital-scheduling-agent","description":"Multi-turn hospital patient scheduling and triage agent environment with realistic clinical scenarios, constraint satisfaction, and emergency handling","visibility":"PUBLIC","owner":{"type":"user","name":"juan"},"created_at":"2026-08-28T03:24:45.831000","updated_at":"2026-08-28T03:25:49.780000","tags":["healthcare","scheduling","triage","multi-turn","constraint-satisfaction","agent","clinical-decision-making"],"stars":1,"latest_ci_status":null,"latest_version":"1.0.0"},{"id":"k08nhmax2t9eecbd5g0ytw53","name":"ladr-axler","description":"Linear Algebra Done Right (Axler, 4e) as exactly-graded tasks over Q: minimal polynomials, invariant subspaces, adjoints, singular values. Binary r...","visibility":"PUBLIC","owner":{"type":"user","name":"nair-akash"},"created_at":"2026-08-28T01:40:24.252000","updated_at":"2026-08-28T01:42:50.733000","tags":["math","linear-algebra","textbook","single-turn","exact","synthetic","train","eval"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.1"},{"id":"c9n2zlsmrnjtnwic39w43z6b","name":"smart-city-traffic-light-controller","description":"Real-world smart city traffic light controller: design adaptive signal timing, optimize traffic flow, handle emergency preemption, and debug inters...","visibility":"PUBLIC","owner":{"type":"user","name":"everes"},"created_at":"2026-08-27T14:37:11.102000","updated_at":"2026-08-27T14:37:29.157000","tags":["real-world","smart-city","traffic-control","optimization","embedded-systems","simulation"],"stars":1,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"cyz8hfdxpy9ok6la3baqkp65","name":"re-decompiler-challenge","description":"Reverse Engineering and Decompiler Challenge environment for training LLMs to analyze assembly, bytecode, and obfuscated code","visibility":"PUBLIC","owner":{"type":"user","name":"jewell"},"created_at":"2026-08-27T07:01:14.325000","updated_at":"2026-08-27T07:07:32.083000","tags":["reverse-engineering","decompiler","assembly","cybersecurity","code-analysis"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.1"},{"id":"nrilfxr877245fy32qp3yr49","name":"iac-agent","description":"Infrastructure-as-Code Agent environment evaluating Terraform and Ansible code generation, debugging, architecture design, and best practices adher...","visibility":"PUBLIC","owner":{"type":"user","name":"karcam"},"created_at":"2026-08-27T05:24:01.165000","updated_at":"2026-08-27T05:25:21.377000","tags":["infrastructure-as-code","terraform","ansible","devops","cloud","aws","iac","automation"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"knpjy6kozd5m78x7zwiirj31","name":"haicai-v1","description":"haicai-v1 — escrever haicai 5-7-5 em português brasileiro; escansão por intervalos + ortografia AO90.","visibility":"PUBLIC","owner":{"type":"user","name":"ob1"},"created_at":"2026-08-27T05:06:36.003000","updated_at":"2026-09-02T08:43:49.084000","tags":["creative-writing","portuguese","single-turn","deterministic"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.2"},{"id":"lg7n5dhkxxb2w66d595yg3hg","name":"graphql-schema-optimizer","description":"Evaluates LLM ability to design GraphQL schemas, optimize queries, fix N+1 problems, implement DataLoader patterns, and analyze query complexity fo...","visibility":"PUBLIC","owner":{"type":"user","name":"roger"},"created_at":"2026-08-26T13:43:38.881000","updated_at":"2026-08-26T13:43:57.270000","tags":["graphql","schema-design","query-optimization","n-plus-one","dataloader","api-design","performance","federation","subscriptions","security"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"ld0jupm6rymgp1hspiw5qppd","name":"microservices-orchestration-simulator","description":"Microservices Orchestration Simulator: evaluate LLM reasoning about service mesh design, failure recovery, load balancing, circuit breakers, and re...","visibility":"PUBLIC","owner":{"type":"user","name":"kennel"},"created_at":"2026-08-26T13:23:28.921000","updated_at":"2026-08-26T13:25:04.265000","tags":["microservices","orchestration","distributed-systems","service-mesh","devops","simulation"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.1"},{"id":"ied0h8bs88iv0o5iwh982pd1","name":"memory-arena","description":"MemoryArena: evaluate whether agents can maintain a memory state — recall, update, contradiction resolution, temporal tracking, relational reasoning.","visibility":"PUBLIC","owner":{"type":"user","name":"nikil"},"created_at":"2026-08-26T11:41:48.852000","updated_at":"2026-08-26T12:00:42.941000","tags":["memory","agents","single-turn","train","eval"],"stars":2,"latest_ci_status":null,"latest_version":"0.1.1"},{"id":"ckdvmq8kr3h67qa7rg6ct23l","name":"commonground-elicit","description":"Structured policy-issue diagnosis and single-target clarification over synthetic stakeholder scenarios.","visibility":"PUBLIC","owner":{"type":"user","name":"charliethompson"},"created_at":"2026-08-26T00:56:07.551000","updated_at":"2026-09-05T06:26:26.018000","tags":["social-reasoning","elicitation","document-analysis","deterministic","single-turn","train","eval"],"stars":2,"latest_ci_status":null,"latest_version":"0.6.1"},{"id":"pw9pxarry8szy6syfjpto32b","name":"commonground-predict","description":"Probabilistic masked-vote prediction over synthetic stakeholder panels.","visibility":"PUBLIC","owner":{"type":"user","name":"charliethompson"},"created_at":"2026-08-26T00:56:01.961000","updated_at":"2026-09-05T06:26:18.517000","tags":["social-reasoning","vote-prediction","deterministic","single-turn","train","eval"],"stars":2,"latest_ci_status":null,"latest_version":"0.6.1"},{"id":"r4q8fjeufcho1hsxxesjrov3","name":"meeting-slot","description":"Multi-turn tool-using meeting scheduler: find the earliest UTC start across hidden calendars, timezones, and working hours.","visibility":"PUBLIC","owner":{"type":"user","name":"devtechedge"},"created_at":"2026-08-25T20:37:39.197000","updated_at":"2026-08-25T21:04:04.348000","tags":["multi-turn","tool-use","calendar","train","eval","verifiable","rlvr"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.2"},{"id":"fxz80yqu3t7273jzzlcvu4j9","name":"markov-blanket-discovery","description":"Recover a Markov blanket when faithfulness is violated — harvested from arXiv 2607.26357, where marginal independence testing provably collapses.","visibility":"PUBLIC","owner":{"type":"team","name":"shinpaku"},"created_at":"2026-08-25T19:08:39.252000","updated_at":"2026-08-25T21:14:36.037000","tags":["causal-discovery","feature-selection","harvested-from-paper","single-turn","code","train","eval"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.1"},{"id":"q03m0xkhsm0lbzkjlvstjrxy","name":"poisson-subspace-clustering","description":"Cluster Poisson count data whose informative structure lives in an unknown subspace — harvested from arXiv 2608.23287, with a verified published ta...","visibility":"PUBLIC","owner":{"type":"team","name":"shinpaku"},"created_at":"2026-08-25T19:08:29.335000","updated_at":"2026-08-25T21:14:26.413000","tags":["clustering","count-data","harvested-from-paper","single-turn","code","verified-target","train","eval"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.2"},{"id":"rlayldsno7l700s999ae26pi","name":"calendar-math","description":"Single-turn calendar arithmetic (date offset, day count, weekday) with a deterministic datetime grader.","visibility":"PUBLIC","owner":{"type":"user","name":"devtechedge"},"created_at":"2026-08-25T18:49:44.463000","updated_at":"2026-08-25T20:48:55.593000","tags":["single-turn","math","calendar","train","eval","verifiable","rlvr"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.3"},{"id":"y2pf2q0wbo428horfz04m2xk","name":"causal-gym","description":"Procedural causal-inference tasks with hidden seeded ground truth.","visibility":"PUBLIC","owner":{"type":"user","name":"ulcompute"},"created_at":"2026-08-25T12:58:02.374000","updated_at":"2026-08-25T13:21:22.060000","tags":["causal-inference","statistics","data-analysis","reasoning","tool-use","procedural","reward-hacking-resistant"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.2"},{"id":"ve1pref8isn9lo3ctkfv8rhv","name":"xlam-qwencoder-env","description":"A function calling environment evaluating the XLAM function-calling dataset using the Qwen3 coder tool format.","visibility":"PUBLIC","owner":{"type":"user","name":"purururu"},"created_at":"2026-08-25T09:36:05.416000","updated_at":"2026-08-25T13:09:48.722000","tags":["function-calling","xlam","qwen3","tool-use","eval"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"iggw1d4lc1ls0uniyqup9ka1","name":"ramsey-combinatorics","description":"Frontier Ramsey / Schur / van der Waerden construction environment with a bitset verifier (<50ms) and an open-problem difficulty ceiling.","visibility":"PUBLIC","owner":{"type":"user","name":"drxddy"},"created_at":"2026-08-25T06:56:09.874000","updated_at":"2026-08-25T06:56:14.310000","tags":["math","combinatorics","ramsey","schur","vdw","single-turn","train","eval","open-problems"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"f2nryfvpef29sv189u4et6pr","name":"formal-verification-trainer","description":"Formal verification and model checking trainer: temporal logic, CTL/LTL properties, Kripke structures, counterexample generation, and abstraction r...","visibility":"PUBLIC","owner":{"type":"user","name":"marry"},"created_at":"2026-08-25T01:26:26.961000","updated_at":"2026-08-25T01:27:17.748000","tags":["formal-verification","model-checking","temporal-logic","ctl","ltl","kripke-structures","automata-theory"],"stars":1,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"onys0pgx4ywe90pssrmvbmcy","name":"code-golf-optimizer","description":"Train LLMs to write maximally concise code that passes correctness tests. Evaluates correctness, byte-length efficiency, and golf technique usage a...","visibility":"PUBLIC","owner":{"type":"user","name":"helen"},"created_at":"2026-08-24T14:20:34.360000","updated_at":"2026-08-24T14:22:16.852000","tags":["code-golf","optimization","python","algorithms","code-generation","efficiency"],"stars":0,"latest_ci_status":null,"latest_version":"1.0.0"},{"id":"epxzahmjnqj3gm2e35asmd9w","name":"androidworld-dense","description":"Dense-reward wrapper around the AndroidWorld verifiers environment: partial-progress reward (app routing, action validity, efficiency) on top of na...","visibility":"PUBLIC","owner":{"type":"user","name":"rohiitspace"},"created_at":"2026-08-24T13:12:16.797000","updated_at":"2026-08-24T20:25:36.099000","tags":["mobile","android","multi-turn","tool-use","vision","gui-agent","dense-reward","curriculum","eval","train"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.5"},{"id":"zabday8qojumyg9qx6czvv1q","name":"binary-exploitation-ctf","description":"Binary exploitation and CTF challenge environment for training LLMs on vulnerability analysis, exploit development, and reverse engineering across ...","visibility":"PUBLIC","owner":{"type":"user","name":"tonggian"},"created_at":"2026-08-24T10:55:35.410000","updated_at":"2026-08-24T10:56:19.167000","tags":["binary-exploitation","ctf","cybersecurity","reverse-engineering","pwn","vulnerability-analysis","exploit-development"],"stars":1,"latest_ci_status":null,"latest_version":"1.0.0"},{"id":"txes421y3v96joatfjo4qpph","name":"hands-visible","description":"Are hands (or grippers) visible in the clip? Capture-QA eval for robot-training video, scored against a reviewed answer sheet (machine-graded provi...","visibility":"PUBLIC","owner":{"type":"user","name":"referee-lab"},"created_at":"2026-08-23T22:42:49.372000","updated_at":"2026-08-24T19:33:35.476000","tags":["eval","multimodal","robotics","vision","capture-qa"],"stars":0,"latest_ci_status":null,"latest_version":"0.3.6"},{"id":"htf9qi97vkf0zfclytjz2t4m","name":"clip-twin","description":"Are these two clips the same underlying footage (possibly re-encoded, cropped, flipped, or brightness-shifted)? Duplicate/resell detection eval, go...","visibility":"PUBLIC","owner":{"type":"user","name":"referee-lab"},"created_at":"2026-08-23T22:39:12.177000","updated_at":"2026-08-24T16:46:43.873000","tags":["eval","multimodal","video","capture-qa","fraud"],"stars":0,"latest_ci_status":null,"latest_version":"0.2.0"},{"id":"gmyiytxxfsx2xqvqss1mwmbt","name":"escalation-router","description":"Will a small 7B VLM get this capture-QA clip right, or must it escalate to a stronger judge? Router eval with measured gold.","visibility":"PUBLIC","owner":{"type":"user","name":"referee-lab"},"created_at":"2026-08-23T22:38:49.077000","updated_at":"2026-08-23T22:39:09.756000","tags":["eval","multimodal","capture-qa","routing","judge"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"c5nphw4gysh0yw8ri3lt9dnw","name":"billable-fraction","description":"What percentage of this clip's frames are usable footage? Capture-yield eval with injected defects and gold by construction.","visibility":"PUBLIC","owner":{"type":"user","name":"referee-lab"},"created_at":"2026-08-23T22:38:36.016000","updated_at":"2026-08-23T22:38:46.547000","tags":["eval","multimodal","video","capture-qa","data-quality"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"ymnb0edqjv106vo5tgtqhbf7","name":"effective-fps","description":"Was this footage really captured at its claimed frame rate, or upsampled from a lower one? Temporal-integrity eval with gold by construction.","visibility":"PUBLIC","owner":{"type":"user","name":"referee-lab"},"created_at":"2026-08-23T22:38:22.370000","updated_at":"2026-08-24T03:09:44.327000","tags":["eval","multimodal","video","capture-qa","data-quality"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.2"},{"id":"w41actb69lwqf78f0kra5gyx","name":"concurrent-bug-finder","description":"Multi-language concurrent and multi-threading bug detection environment covering race conditions, deadlocks, data races, TOCTOU, resource leaks, an...","visibility":"PUBLIC","owner":{"type":"user","name":"voavoa"},"created_at":"2026-08-22T09:31:22.047000","updated_at":"2026-08-22T09:32:14.945000","tags":["concurrency","multi-threading","bug-finding","race-condition","deadlock","code-analysis"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"e7ybbktli55jyjz2xy2as1za","name":"oihk-security-agent","description":"Evaluate models as autonomous security agents inside the real OIHK multi-agent pentesting engine — scored by a programmatic verifier, never an LLM ...","visibility":"PUBLIC","owner":{"type":"user","name":"broskigx"},"created_at":"2026-08-22T05:13:09.311000","updated_at":"2026-08-22T18:09:21.602000","tags":["eval","train","agent","tool-use","security","cybersecurity","long-context"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.3"},{"id":"mlboec7cq52jdqtm91hdgbvf","name":"arch-review-v1","description":"Architectural code review eval environment for the Prime Intellect Environments Hub","visibility":"PUBLIC","owner":{"type":"team","name":"korck"},"created_at":"2026-08-21T23:35:56.278000","updated_at":"2026-08-24T19:07:56.791000","tags":["code-review","evaluation","llm-judge","software-engineering","code-quality","defect-detection"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.4"},{"id":"ej2hr8790fk3hoki6pn56ryi","name":"grc-mapping","description":"Compliance control mapping across 686 frameworks, graded against a live knowledge graph with 38,707 published refutations.","visibility":"PUBLIC","owner":{"type":"team","name":"theartofservice"},"created_at":"2026-08-21T22:54:31.230000","updated_at":"2026-08-22T02:34:42.487000","tags":["single-turn","compliance","grc","reasoning","v1"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.5"},{"id":"l4pwmdtbs33lcj8n8pw0nk1l","name":"prime_forge_v1","description":"Prime Forge 166 synthetic AutomationBench tasks with V1 tool contract and PR #764 fixes.","visibility":"PUBLIC","owner":{"type":"team","name":"prime"},"created_at":"2026-08-21T22:20:11.157000","updated_at":"2026-08-21T23:22:16.970000","tags":["multi-turn","tool-use","v1"],"stars":0,"latest_ci_status":null,"latest_version":"1.0.3"},{"id":"i9yl6bxtq6yjjydew1jpernc","name":"research-debugging","description":"Diagnose, repair, and rerun a research study whose headline conclusion is wrong.","visibility":"PUBLIC","owner":{"type":"team","name":"mayokun26"},"created_at":"2026-08-21T08:14:12.697000","updated_at":"2026-08-21T13:14:32.524000","tags":["research-debugging","data-analysis","deterministic-verifier","agent","multi-turn","eval"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.2"},{"id":"d22obrcokz1ig8c014rwq7w6","name":"supabase-evals","description":"Supabase agent evals via OpenCode (pinned supabase/evals clone, MCP, EVAL.ts scoring)","visibility":"PUBLIC","owner":{"type":"user","name":"dmnsh001"},"created_at":"2026-08-21T03:50:19.949000","updated_at":"2026-08-21T03:50:29.643000","tags":["eval","supabase","sandbox","opencode"],"stars":0,"latest_ci_status":null,"latest_version":"0.4.0"},{"id":"bm6x62pbxd1y9f6xi90ibb0t","name":"sregym-env","description":"SREGym — procedurally generated, deterministically verified on-call incident response (verifiers v1 taskset).","visibility":"PUBLIC","owner":{"type":"user","name":"ericxu88"},"created_at":"2026-08-21T00:08:04.606000","updated_at":"2026-08-21T01:14:30.167000","tags":["sre","incident-response","tool-use","multi-turn","agent","train","eval"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.4"},{"id":"i2exzcz43sddvp8xlh85jm3p","name":"hanabi-cooperative-card-game","description":"Hanabi cooperative card game environment: strategic hint-giving, card deduction, and cooperative play evaluation for LLM reasoning","visibility":"PUBLIC","owner":{"type":"user","name":"tommii"},"created_at":"2026-08-20T13:58:59.496000","updated_at":"2026-08-20T13:59:59.056000","tags":["game-theory","cooperative-ai","reasoning","card-games","strategy"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"i0bzwr6bkzv0nhvdspxkfajq","name":"dominion-deck-building","description":"Deck-building strategy environment inspired by Dominion — evaluate kingdom card synergies, optimize buy phases, and compute VP projections","visibility":"PUBLIC","owner":{"type":"user","name":"polo"},"created_at":"2026-08-20T13:35:35.783000","updated_at":"2026-08-20T13:36:52.102000","tags":["strategy","deck-building","board-game","decision-making","combinatorics"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"btfgs9h6yctcxbuw0n55on87","name":"itsm-bench","description":"ITSMBench (Enterprise-Worlds): a live ITSM tenant with 93 typed tools, a policy, and a simulated operator — 53 multi-turn tasks graded on the final...","visibility":"PUBLIC","owner":{"type":"team","name":"vibrantlabsai"},"created_at":"2026-08-20T12:54:52.694000","updated_at":"2026-08-24T14:14:41.311000","tags":["multi-turn","tool-use","agent","enterprise","itsm","user-simulation","train","eval"],"stars":0,"latest_ci_status":null,"latest_version":"0.2.0"},{"id":"ha4ys1uu1zwywg5emi78veec","name":"solar-eval","description":"Deterministically-graded RL environment for residential solar and battery quoting: five task families, a PVGIS-backed oracle, and no LLM judge.","visibility":"PUBLIC","owner":{"type":"team","name":"solar-sight"},"created_at":"2026-08-20T07:09:54.696000","updated_at":"2026-08-20T08:36:07.572000","tags":[],"stars":0,"latest_ci_status":null,"latest_version":"0.2.1"},{"id":"r0atb3zknct1bjp0phwvilk4","name":"numpy-scipy-exact","description":"Verifiable environment: the exact values behind classic numpy/scipy linear-algebra calls (charpoly coefficients, inverse entries, matrix-power trac...","visibility":"PUBLIC","owner":{"type":"user","name":"halfounce"},"created_at":"2026-08-20T04:19:34.389000","updated_at":"2026-08-20T04:19:37.033000","tags":["math","linear-algebra","numpy","scipy","exact-verification","eval","train"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"o4lpvggjvta3ybw07ttp0ajj","name":"exact-determinant","description":"Verifiable environment: compute exact integer determinants. Reward recomputes det(A) by fraction-free integer elimination; guess-resistant by const...","visibility":"PUBLIC","owner":{"type":"user","name":"halfounce"},"created_at":"2026-08-20T02:49:49.665000","updated_at":"2026-08-20T03:26:42.770000","tags":["math","linear-algebra","exact-verification","eval","train"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.1"},{"id":"eqeoh16rur2mbify8gcrf8an","name":"shell-ops","description":"Verifiable command-line tasks scored by an independent verifier the model never sees.","visibility":"PUBLIC","owner":{"type":"user","name":"boopathiraja"},"created_at":"2026-08-19T11:20:49.666000","updated_at":"2026-08-19T11:20:55.116000","tags":["agent","code","tools","eval"],"stars":0,"latest_ci_status":null,"latest_version":"0.2.0"},{"id":"eurif0f7gy6jrpj4mgdxlouv","name":"catan-resource-trading-simulator","description":"Catan-themed resource management and trading strategy environment for evaluating LLM reasoning about optimal trades, resource allocation, and settl...","visibility":"PUBLIC","owner":{"type":"user","name":"tohan"},"created_at":"2026-08-19T11:20:48.648000","updated_at":"2026-08-19T11:22:30.135000","tags":["game-theory","resource-management","trading","strategy","catan"],"stars":1,"latest_ci_status":null,"latest_version":"0.1.1"},{"id":"r8qktjz2igfq9iawn8iqbgpt","name":"automationbench_v1_test","description":"Zapier AutomationBench business workflows with task-scoped, structured API discovery and execution.","visibility":"PUBLIC","owner":{"type":"team","name":"prime"},"created_at":"2026-08-19T05:17:54.569000","updated_at":"2026-08-19T05:17:58.412000","tags":["multi-turn","tool-use","v1"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"g2jxhhfpu6oin8hzicu2hg26","name":"carcassonne-tile-laying-agent","description":"Evaluate LLM agents on Carcassonne board game tile placement strategy, terrain matching, and scoring optimization","visibility":"PUBLIC","owner":{"type":"user","name":"realm"},"created_at":"2026-08-18T13:58:12.758000","updated_at":"2026-08-18T13:58:44.364000","tags":["game-playing","strategy","board-game","tile-placement","spatial-reasoning","carcassonne"],"stars":1,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"p2uu25kg2b0sxyg12wvy2cx2","name":"the-scientist","description":"A stateful RL environment for discovering hidden scientific laws through active experimentation.","visibility":"PUBLIC","owner":{"type":"user","name":"ritwikraha"},"created_at":"2026-08-18T06:16:51.833000","updated_at":"2026-08-25T13:04:48.730000","tags":["science","tool-use","active-learning","reasoning","train","eval"],"stars":0,"latest_ci_status":null,"latest_version":"0.2.0"},{"id":"oj2gvpr6vghy9n8n7b84o8vd","name":"algebra-steps","description":"Solve linear equations in one variable step by step; deterministic sympy rubric over the answer, the step chain, and the format.","visibility":"PUBLIC","owner":{"type":"user","name":"iinmotion"},"created_at":"2026-08-18T02:59:53.582000","updated_at":"2026-08-18T02:59:57.326000","tags":["math","algebra","single-turn","train","eval"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"kcn5gpqho5r3ewtfrxx35doi","name":"blokus-geometric-placement","description":"Evaluates spatial reasoning through Blokus board game piece placement tasks including valid placement, counting, multi-piece coordination, and opti...","visibility":"PUBLIC","owner":{"type":"user","name":"fran"},"created_at":"2026-08-17T15:46:37.357000","updated_at":"2026-08-17T15:47:02.379000","tags":["spatial-reasoning","geometry","board-game","blokus","placement","combinatorics"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"zrjihhj1fqo8x4ditwl0j6b0","name":"quoridor-path-blocking","description":"Quoridor path-blocking board game strategy environment for evaluating LLM spatial reasoning and game-theoretic planning","visibility":"PUBLIC","owner":{"type":"user","name":"pronul"},"created_at":"2026-08-17T14:13:00.827000","updated_at":"2026-08-17T14:15:25.740000","tags":["game-strategy","spatial-reasoning","board-game","pathfinding","quoridor"],"stars":1,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"csqynmduephxniwwajjpdh1d","name":"omp-coding","description":"Sealed coding tasks driven through OMP on Prime Verifiers v1.","visibility":"PUBLIC","owner":{"type":"user","name":"dylantirandaz"},"created_at":"2026-08-17T14:01:19.599000","updated_at":"2026-08-18T19:49:09.669000","tags":["coding","agent","tools","omp"],"stars":0,"latest_ci_status":null,"latest_version":"1.1.7"},{"id":"alxf35ghp4kuh52dubbcqmxt","name":"mcmcenv","description":"Prime Intellect RL environment for posterior-geometry MCMC sampler design","visibility":"PUBLIC","owner":{"type":"user","name":"punnettsquare9331"},"created_at":"2026-08-16T23:19:37.541000","updated_at":"2026-08-17T08:41:24.772000","tags":["reinforcement-learning","mcmc","statistics","nimble","sampler-design"],"stars":0,"latest_ci_status":null,"latest_version":"0.7.2"},{"id":"cmm1ize0coh1e0s1ykeaxtqu","name":"hive-insect-board-game","description":"Environment for evaluating LLM strategic reasoning through Hive insect board game mechanics, move validation, and tactical analysis","visibility":"PUBLIC","owner":{"type":"user","name":"audition"},"created_at":"2026-08-16T14:16:32.914000","updated_at":"2026-08-16T14:17:38.495000","tags":["board-game","strategy","hive","insect","reasoning","game-theory"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"pd0hj0e1ab9yntp92ad12d6s","name":"abalone-strategy-game","description":"Evaluate LLM strategic reasoning through Abalone board game - move analysis, push mechanics, endgame puzzles, and strategic planning","visibility":"PUBLIC","owner":{"type":"user","name":"nelio"},"created_at":"2026-08-16T14:04:58.221000","updated_at":"2026-08-16T14:06:28.566000","tags":["strategy","board-game","abalone","tactical-reasoning","game-theory"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"evnvv5pdxy8vtusnl17qr6it","name":"co-tuong-xiangqi","description":"Chinese Chess (Xiangqi / Co Tuong) knowledge evaluation environment testing rules, tactics, openings, strategy, and notation","visibility":"PUBLIC","owner":{"type":"user","name":"bingbong"},"created_at":"2026-08-14T13:55:12.301000","updated_at":"2026-08-14T14:08:48.389000","tags":["xiangqi","chinese-chess","co-tuong","board-game","strategy","reasoning","knowledge-evaluation"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.1"},{"id":"wspab3qe7ocllj88cq513v2d","name":"ps-primal","description":"Paired-associate recall (single-turn proxy) from psychscanner: score word-pair recall accuracy across five semantic-similarity levels.","visibility":"PUBLIC","owner":{"type":"user","name":"saurabhr"},"created_at":"2026-08-14T03:03:02.031000","updated_at":"2026-08-14T03:03:04.759000","tags":["psychology","cognitive-science","memory","single-turn","train","eval"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"rdap0bk97kj7tc5aahmt2lby","name":"psychscanner-nback","description":"N-back working-memory task from psychscanner: judge whether the current letter matches the one n positions back, under conversation- vs summary-mem...","visibility":"PUBLIC","owner":{"type":"user","name":"saurabhr"},"created_at":"2026-08-14T03:02:44.380000","updated_at":"2026-08-14T03:02:47.291000","tags":["psychology","cognitive-science","working-memory","single-turn","train","eval"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"adrcbzejkjkxfczfcn4gv10g","name":"xray-diagnosis","description":"Medical X-ray image reading and diagnosis environment - evaluates model ability to interpret radiographic findings, identify pathologies, and provi...","visibility":"PUBLIC","owner":{"type":"user","name":"ironmen"},"created_at":"2026-08-14T01:25:46.239000","updated_at":"2026-08-14T05:49:05.390000","tags":["medical","radiology","xray","diagnosis","clinical-reasoning"],"stars":0,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"ywd1k9wb701w5z4wir0nwwxp","name":"cad-spec","description":"Write CadQuery from a dimensioned mechanical spec. Scored by executing the code and measuring the resulting solid: per-requirement PASS/FAIL on dim...","visibility":"PUBLIC","owner":{"type":"user","name":"bazzouzi"},"created_at":"2026-08-13T20:13:18.678000","updated_at":"2026-08-13T20:18:21.624000","tags":["cad","engineering","code-generation","cadquery","geometry","train","eval"],"stars":2,"latest_ci_status":null,"latest_version":"0.1.0"},{"id":"em3zuqiwuc6d0lg4hhjta8kp","name":"app-pot-code-eval","description":"Code evaluation environment for app/pot-style programming problems","visibility":"PUBLIC","owner":{"type":"user","name":"cosmonaut"},"created_at":"2026-08-13T20:00:03.420000","updated_at":"2026-08-14T12:04:55.437000","tags":["code","evaluation","python","programming"],"stars":1,"latest_ci_status":null,"latest_version":"0.1.2"}],"status":null}