BIOTOOLS.ir

Транскриптом

Нормализация счётов: CPM, TPM, FPKM

Перевод матрицы сырых счётов RNA-seq в CPM, TPM или FPKM с размером библиотеки и числом обнаруженных генов по каждому образцу.

Матрица счётов

Первый столбец — идентификатор гена, остальные — счёты по образцам. Столбец с именем length используется для TPM и FPKM. Разделителем может быть табуляция, запятая или точка с запятой.

Статистика библиотек

Нормализованная матрица

Чаще всего упускают вот что: TPM нельзя посчитать для одного гена, поскольку знаменатель — сумма нормированных на длину величин по всем генам образца. Поэтому инструмент берёт таблицу целиком, а не одну строку. TPM и FPKM различаются лишь порядком двух шагов нормализации: в TPM сначала делят на длину, затем на сумму, в FPKM наоборот; именно поэтому столбцы TPM в сумме дают ровно миллион, а FPKM — нет. Ни то, ни другое не заменяет межобразцовую нормализацию DESeq2 при анализе дифференциальной экспрессии.

Войти — войдите, чтобы сохранить результат

Формула

TPM = (счёт ÷ длина) ÷ Σ(счёт ÷ длина) × 10⁶

CPM
счёт, делённый на размер библиотеки, умноженный на миллион — длина не учитывается
FPKM
сначала деление на размер библиотеки, затем на длину
TPM
сначала деление на длину, затем на сумму — каждый столбец даёт ровно миллион

Разобранный пример

Почему TPM нельзя посчитать для одного гена

  • g1: длина 1000, счёт 10
  • g2: длина 2000, счёт 30
  • g3: длина 500, счёт 60
  1. Скорость по гену: счёт, делённый на длину в тысячах оснований. Это 10, 15 и 120.
  2. Сумма скоростей: 145. Это число зависит от всех генов образца.
  3. TPM гена: его скорость, делённая на 145, умноженная на миллион.

Ответ g1 равен 68 966 — числу, недостижимому без g2 и g3

Частые ошибки

  • Нормализовать уже нормализованную матрицу. Если большинство значений не целые, вероятно, вставлены TPM или FPKM вместо сырых счётов; инструмент об этом предупреждает.
  • Сравнивать CPM двух генов между собой. CPM не учитывает длину, и более длинный ген набирает больше прочтений по построению; для сравнений внутри образца берите TPM.
  • Сравнивать FPKM между образцами. Столбцы FPKM не дают фиксированной суммы, поэтому прямое сравнение вводит в заблуждение. У TPM этого недостатка нет.
  • Подавать эти значения на вход анализа дифференциальной экспрессии. DESeq2 и edgeR требуют сырых счётов и сами выполняют межобразцовую нормализацию.

Частые вопросы

TPM или FPKM?

TPM. Они различаются лишь порядком двух шагов, но поскольку каждый столбец TPM в сумме даёт миллион, доля гена сопоставима между образцами. У FPKM такой гарантии нет.

Где взять длины генов?

Из той же аннотации, по которой считались прочтения. featureCounts выводит столбец Length. Для большей точности предпочтительна эффективная длина из Salmon или RSEM.

Какой размер библиотеки нужен?

Зависит от задачи, но разброс между образцами важнее абсолютной величины. Если сумма счётов одного образца в разы меньше остальных, разберитесь с ним до анализа.

Похожие инструменты