md: refactor idle/frozen_sync_thread() to fix deadlock

author Yu Kuai <yukuai3@huawei.com>

Mon, 29 May 2023 13:20:35 +0000 (21:20 +0800)

committer Song Liu <song@kernel.org>

Thu, 27 Jul 2023 07:13:28 +0000 (00:13 -0700)
author Yu Kuai <yukuai3@huawei.com>
Mon, 29 May 2023 13:20:35 +0000 (21:20 +0800)
committer Song Liu <song@kernel.org>
Thu, 27 Jul 2023 07:13:28 +0000 (00:13 -0700)
diff --git a/drivers/md/md.c b/drivers/md/md.c

index 3d7e87c..920701a 100644 (file)
--- a/drivers/md/md.c
+++ b/drivers/md/md.c
@@ -651,6 +651,7 @@ void mddev_init(struct mddev *mddev)
         timer_setup(&mddev->safemode_timer, md_safemode_timeout, 0);
         atomic_set(&mddev->active, 1);
         atomic_set(&mddev->openers, 0);
+       atomic_set(&mddev->sync_seq, 0);
         spin_lock_init(&mddev->lock);
         atomic_set(&mddev->flush_pending, 0);
         init_waitqueue_head(&mddev->sb_wait);
@@ -4768,19 +4769,27 @@ static void stop_sync_thread(struct mddev *mddev)
         if (work_pending(&mddev->del_work))
                 flush_workqueue(md_misc_wq);
  
-       if (mddev->sync_thread) {
-               set_bit(MD_RECOVERY_INTR, &mddev->recovery);
-               md_reap_sync_thread(mddev);
-       }
+       set_bit(MD_RECOVERY_INTR, &mddev->recovery);
+       /*
+        * Thread might be blocked waiting for metadata update which will now
+        * never happen
+        */
+       md_wakeup_thread_directly(mddev->sync_thread);
  
         mddev_unlock(mddev);
  }
  
  static void idle_sync_thread(struct mddev *mddev)
  {
+       int sync_seq = atomic_read(&mddev->sync_seq);
+
         mutex_lock(&mddev->sync_mutex);
         clear_bit(MD_RECOVERY_FROZEN, &mddev->recovery);
         stop_sync_thread(mddev);
+
+       wait_event(resync_wait, sync_seq != atomic_read(&mddev->sync_seq) ||
+                       !test_bit(MD_RECOVERY_RUNNING, &mddev->recovery));
+
         mutex_unlock(&mddev->sync_mutex);
  }
  
@@ -4789,6 +4798,10 @@ static void frozen_sync_thread(struct mddev *mddev)
         mutex_lock(&mddev->sync_mutex);
         set_bit(MD_RECOVERY_FROZEN, &mddev->recovery);
         stop_sync_thread(mddev);
+
+       wait_event(resync_wait, mddev->sync_thread == NULL &&
+                       !test_bit(MD_RECOVERY_RUNNING, &mddev->recovery));
+
         mutex_unlock(&mddev->sync_mutex);
  }
  
@@ -9463,6 +9476,8 @@ void md_reap_sync_thread(struct mddev *mddev)
  
         /* resync has finished, collect result */
         md_unregister_thread(&mddev->sync_thread);
+       atomic_inc(&mddev->sync_seq);
+
         if (!test_bit(MD_RECOVERY_INTR, &mddev->recovery) &&
             !test_bit(MD_RECOVERY_REQUESTED, &mddev->recovery) &&
             mddev->degraded != mddev->raid_disks) {
diff --git a/drivers/md/md.h b/drivers/md/md.h

index 18c168b..914e6ec 100644 (file)
--- a/drivers/md/md.h
+++ b/drivers/md/md.h
@@ -537,6 +537,8 @@ struct mddev {
  
         /* Used to synchronize idle and frozen for action_store() */
         struct mutex                    sync_mutex;
+       /* The sequence number for sync thread */
+       atomic_t sync_seq;
  
         bool    has_superblocks:1;
         bool    fail_last_dev:1;
author	Yu Kuai <yukuai3@huawei.com>
	Mon, 29 May 2023 13:20:35 +0000 (21:20 +0800)
committer	Song Liu <song@kernel.org>
	Thu, 27 Jul 2023 07:13:28 +0000 (00:13 -0700)
drivers/md/md.c		patch \| blob \| history
drivers/md/md.h		patch \| blob \| history