{
  "states": [
    "a",
    "b",
    "c",
    "d"
  ],
  "rewards": [
    1,
    0,
    2
  ],
  "discount": 0.9,
  "learning_rate": 0.2,
  "lambda": 0,
  "terminal": true,
  "values": {
    "a": 0,
    "b": 1,
    "c": 0,
    "d": 0
  }
}
