Benchmark AI / Public workspace

ARC-AGI-2

Reasoning

ARC-AGI-2 evaluates the ability to infer unfamiliar rules from a few examples and apply them to new grids. Training and evaluation are separate; this import covers the 120 public evaluation tasks.

Japanese introduction

少数の入出力例から未知の規則を推測し、新しいグリッドに適用する能力を評価します。trainingとevaluationが分かれており、今回の取得対象は公開evaluationの120課題です。

arc-agi-2

Full text120 tasksProblems imported

Official source

Full text: eligible public problems include text, images and discussion.

Tasks

Whole public benchmark.

Public problems
120
Formats
grid (120)
Problems with images
0
Answer availability
Answer published by the source (120)
Configs
Default (120)
Splits
evaluation (120)
Awaiting a first discussion
118

Discussion