BIOTOOLS.ir

ترانسکریپتوم

تصحیح چندگانه و نمودار آتشفشانی

تصحیح p-value برای آزمون‌های چندگانه با چهار روش، شمارش ژن‌های معنادار و رسم نمودار آتشفشانی از خروجی DESeq2 یا edgeR.

جدول نتایج

ستون‌ها از روی سرستون شناسایی می‌شوند: نام ژن، log2FoldChange و pvalue. اگر سرستون نباشد، ترتیب ستون اول تا سوم همین فرض می‌شود.

ژن آزموده‌شده
معنادار
افزایش
کاهش

روش Benjamini-Hochberg نرخ کشف کاذب را کنترل می‌کند و انتخاب متعارف در RNA-seq است. Benjamini-Yekutieli محافظه‌کارتر است و وقتی آزمون‌ها وابستگی دلخواه دارند به کار می‌رود. Bonferroni و Holm نرخ خطای خانوادگی را کنترل می‌کنند و برای ده‌ها هزار ژن بیش از حد سخت‌گیرند. این ابزار p-value تولید نمی‌کند؛ ورودی باید از DESeq2، edgeR یا limma بیاید.

ورود — برای ذخیرهٔ نتیجه وارد شوید

فرمول

p تصحیح‌شده (BH) = کمینهٔ (n ÷ k) × p₍ₖ₎ برای همهٔ k ≥ i

n
تعداد کل ژن‌های آزموده‌شده
k
رتبهٔ ژن پس از مرتب‌سازی صعودی p
BH
کنترل نرخ کشف کاذب — انتخاب متعارف در RNA-seq
Bonferroni
کنترل نرخ خطای خانوادگی — ضرب ساده در n

مثال حل‌شده

پنج ژن با p برابر ۰٫۰۱ تا ۰٫۰۵

  • p = 0.01, 0.02, 0.03, 0.04, 0.05
  • n = 5
  1. برای هر رتبه، p ضربدر n تقسیم بر رتبه: ۰٫۰۵ و ۰٫۰۵ و ۰٫۰۵ و ۰٫۰۵ و ۰٫۰۵
  2. از بزرگ‌ترین به کوچک‌ترین حرکت و کمینهٔ تجمعی گرفته می‌شود تا نتیجه یکنواخت بماند.
  3. با Bonferroni همان p ضربدر ۵ می‌شود: ۰٫۰۵ تا ۰٫۲۵

پاسخ با BH هر پنج ژن در آستانهٔ ۰٫۰۵ معنادارند، با Bonferroni فقط یکی

خطاهای رایج

  • تصحیح دوبارهٔ ستونی که از قبل تصحیح شده. ستون padj در خروجی DESeq2 پیش‌تر با BH تصحیح شده؛ ورودی این ابزار باید ستون pvalue خام باشد.
  • استفاده از Bonferroni برای بیست هزار ژن. این روش برای تعداد کم آزمون ساخته شده و در مقیاس ترانسکریپتوم آن‌قدر سخت‌گیر است که تقریباً همه‌چیز را رد می‌کند.
  • فیلتر کردن ژن‌ها بر اساس p خام و بعد تصحیح روی بازمانده‌ها. این کار نرخ کشف کاذب را می‌شکند؛ تصحیح باید روی همهٔ ژن‌های آزموده‌شده انجام شود.
  • گذاشتن آستانهٔ log2FC روی مقادیر تصحیح‌نشدهٔ شیب. برای ژن‌های کم‌بیان، log2FC خام نویزی است؛ DESeq2 مقادیر جمع‌شده ارائه می‌دهد که برای آستانه‌گذاری مناسب‌ترند.

پرسش‌های متداول

کدام روش را انتخاب کنم؟

برای RNA-seq معمولاً Benjamini-Hochberg. اگر می‌خواهید بدون فرض دربارهٔ وابستگی بین آزمون‌ها محافظه‌کار باشید، Benjamini-Yekutieli. Bonferroni و Holm را برای تعداد کم فرضیه نگه دارید.

چرا بعضی ژن‌ها در خروجی DESeq2 مقدار padj ندارند؟

به‌خاطر فیلتر مستقل: ژن‌هایی که بیان بسیار پایینی دارند از تصحیح کنار گذاشته می‌شوند تا توان آماری بقیه بالا برود. اگر آن سطرها را به این ابزار بدهید، در تصحیح شرکت می‌کنند و نتیجه با DESeq2 فرق خواهد کرد.

محور عمودی نمودار را روی p خام بگذارم یا تصحیح‌شده؟

رسم متعارف با p خام است و معناداری با رنگ نقاط نشان داده می‌شود. اگر می‌خواهید آستانه در نمودار دقیقاً همان آستانهٔ تصمیم‌گیری باشد، p تصحیح‌شده را انتخاب کنید.

ابزارهای مرتبط