Reinforcement Learning Beyond Greedy Optimisation for Delayed-Consequence Accelerator Control JACoW Publishing