ترانسکریپتوم
تصحیح چندگانه و نمودار آتشفشانی
تصحیح p-value برای آزمونهای چندگانه با چهار روش، شمارش ژنهای معنادار و رسم نمودار آتشفشانی از خروجی DESeq2 یا edgeR.
ستونها از روی سرستون شناسایی میشوند: نام ژن، log2FoldChange و pvalue. اگر سرستون نباشد، ترتیب ستون اول تا سوم همین فرض میشود.
روش Benjamini-Hochberg نرخ کشف کاذب را کنترل میکند و انتخاب متعارف در RNA-seq است. Benjamini-Yekutieli محافظهکارتر است و وقتی آزمونها وابستگی دلخواه دارند به کار میرود. Bonferroni و Holm نرخ خطای خانوادگی را کنترل میکنند و برای دهها هزار ژن بیش از حد سختگیرند. این ابزار p-value تولید نمیکند؛ ورودی باید از DESeq2، edgeR یا limma بیاید.
فرمول
p تصحیحشده (BH) = کمینهٔ (n ÷ k) × p₍ₖ₎ برای همهٔ k ≥ i
- n
- تعداد کل ژنهای آزمودهشده
- k
- رتبهٔ ژن پس از مرتبسازی صعودی p
- BH
- کنترل نرخ کشف کاذب — انتخاب متعارف در RNA-seq
- Bonferroni
- کنترل نرخ خطای خانوادگی — ضرب ساده در n
مثال حلشده
پنج ژن با p برابر ۰٫۰۱ تا ۰٫۰۵
- p = 0.01, 0.02, 0.03, 0.04, 0.05
- n = 5
- برای هر رتبه، p ضربدر n تقسیم بر رتبه: ۰٫۰۵ و ۰٫۰۵ و ۰٫۰۵ و ۰٫۰۵ و ۰٫۰۵
- از بزرگترین به کوچکترین حرکت و کمینهٔ تجمعی گرفته میشود تا نتیجه یکنواخت بماند.
- با Bonferroni همان p ضربدر ۵ میشود: ۰٫۰۵ تا ۰٫۲۵
پاسخ با BH هر پنج ژن در آستانهٔ ۰٫۰۵ معنادارند، با Bonferroni فقط یکی
خطاهای رایج
- تصحیح دوبارهٔ ستونی که از قبل تصحیح شده. ستون padj در خروجی DESeq2 پیشتر با BH تصحیح شده؛ ورودی این ابزار باید ستون pvalue خام باشد.
- استفاده از Bonferroni برای بیست هزار ژن. این روش برای تعداد کم آزمون ساخته شده و در مقیاس ترانسکریپتوم آنقدر سختگیر است که تقریباً همهچیز را رد میکند.
- فیلتر کردن ژنها بر اساس p خام و بعد تصحیح روی بازماندهها. این کار نرخ کشف کاذب را میشکند؛ تصحیح باید روی همهٔ ژنهای آزمودهشده انجام شود.
- گذاشتن آستانهٔ log2FC روی مقادیر تصحیحنشدهٔ شیب. برای ژنهای کمبیان، log2FC خام نویزی است؛ DESeq2 مقادیر جمعشده ارائه میدهد که برای آستانهگذاری مناسبترند.
پرسشهای متداول
کدام روش را انتخاب کنم؟
برای RNA-seq معمولاً Benjamini-Hochberg. اگر میخواهید بدون فرض دربارهٔ وابستگی بین آزمونها محافظهکار باشید، Benjamini-Yekutieli. Bonferroni و Holm را برای تعداد کم فرضیه نگه دارید.
چرا بعضی ژنها در خروجی DESeq2 مقدار padj ندارند؟
بهخاطر فیلتر مستقل: ژنهایی که بیان بسیار پایینی دارند از تصحیح کنار گذاشته میشوند تا توان آماری بقیه بالا برود. اگر آن سطرها را به این ابزار بدهید، در تصحیح شرکت میکنند و نتیجه با DESeq2 فرق خواهد کرد.
محور عمودی نمودار را روی p خام بگذارم یا تصحیحشده؟
رسم متعارف با p خام است و معناداری با رنگ نقاط نشان داده میشود. اگر میخواهید آستانه در نمودار دقیقاً همان آستانهٔ تصمیمگیری باشد، p تصحیحشده را انتخاب کنید.