]> git.baikalelectronics.ru Git - kernel.git/commit
percpu_counter: fix bad counter state during suspend
authorJens Axboe <axboe@fb.com>
Sat, 5 Apr 2014 03:26:04 +0000 (21:26 -0600)
committerJens Axboe <axboe@fb.com>
Mon, 7 Apr 2014 14:17:10 +0000 (08:17 -0600)
commit53e1b605d6d3994af2ff70111d471f120b8509b1
tree9f56334e557e2665d51beff152f292ffd1ed5f79
parent3e02e9b2024627a97135904c92765db3be6589c5
percpu_counter: fix bad counter state during suspend

I got a bug report yesterday from Laszlo Ersek <lersek@xxxxxxxxxx>, in
which he states that his kvm instance fails to suspend. He Laszlo
bisected it down to this commit:

commit e50a7eff86b623bbc61a50f56a1a7eef6378296c
Author: Jens Axboe <axboe@xxxxxxxxx>
Date: Fri Nov 1 10:52:52 2013 -0600

virtio_blk: blk-mq support

where virtio-blk is converted to use the blk-mq infrastructure. After
digging a bit, it became clear that the issue was with the queue drain.
blk-mq tracks queue usage in a percpu counter, which is incremented on
request alloc and decremented when the request is freed. The initial
hunt was for an inconsistency in blk-mq, but everything seemed fine. In
fact, the counter only returned crazy values when suspend was in
progress. When a CPU is unplugged, the percpu counters merges that CPU
state with the general state. blk-mq takes care to register a hotcpu
notifier with the appropriate priority, so we know it runs after the
percpu counter notifier. However, the percpu counter notifier only
merges the state when the CPU is fully gone. This leaves a state
transition where the CPU going away is no longer in the online mask, yet
it still holds private values. This means that in this state,
percpu_counter_sum() returns invalid results, and the suspend then hangs
waiting for abs(dead-cpu-value) requests to complete which of course
will never happen.

Fix this by clearing the state earlier, so we never have a case where
the CPU isn't in online mask but still holds private state. This bug has
been there since forever, I guess we don't have a lot of users where
percpu counters needs to be reliable during the suspend cycle.

Reported-by: <lersek@redhat.com>
Tested-by: Laszlo Ersek <lersek@redhat.com>
Signed-off-by: Jens Axboe <axboe@fb.com>
lib/percpu_counter.c