Teoria · Estatística do laudo · Concordância
A ferramenta passa quando discorda como um segundo analista.
Uma ferramenta de contagem não se valida com acurácia contra um rótulo. Ela se valida lendo o mesmo material que analistas treinados, sem ver a resposta deles, e mostrando que discorda deles tanto quanto eles discordam entre si. Esta página traz as contas desse estudo: Bland-Altman, o coeficiente de Lin, o κ, o ICC, o critério de não inferioridade e quantas placas ele pede.
Aprofundar · matemática e referências
O desenho: o mesmo material, lido às cegas
O estudo de concordância tem quatro peças. O material são placas que a ferramenta nunca viu no treino, cobrindo a faixa de viabilidade que aparece na rotina, de perto de 10% a perto de 95%, e as densidades difíceis, com sementes encostadas. A referência são pelo menos três analistas, cada um lendo sem ver a leitura dos outros nem a da ferramenta. As leituras individuais ficam guardadas, porque são elas que medem quanto pessoas treinadas discordam.
As unidades de medida são três: a contagem por imagem, a porcentagem de viáveis por repetição (o número que vai para o laudo) e a classe de cada semente. E o modo da ferramenta fica declarado. No automático ninguém confere nada; no assistido a máquina propõe e a pessoa corrige. Os dois respondem perguntas diferentes, e o estudo precisa dos dois: o assistido é o que se usa, e o automático mostra o que a conferência corrige.
A pergunta não é se a ferramenta acerta um valor verdadeiro, que ninguém conhece. É se, posta no lugar de um dos analistas, ela aumenta a discordância. As seções a seguir dão as contas, e o gerador de pares deixa mexer em cada uma delas.
Bland e Altman: a diferença contra a média
Para cada placa \(i\) há duas leituras, \(y_i\) da ferramenta e \(x_i\) do analista. Bland e Altman [1] propuseram olhar a diferença contra a média das duas:
Definição
O viés é \(\bar d\), a média das diferenças. Os limites de concordância de 95% são \(\bar d \pm 1{,}96\, s_d\), com \(s_d\) o desvio-padrão das diferenças. Se as diferenças forem aproximadamente normais e não dependerem do tamanho da contagem, 95% das placas novas terão a diferença entre os dois limites.
Por que contra a média, e não contra a leitura do analista? Escreva \(x = T + e_x\) e \(y = T + e_y\), com \(T\) o valor verdadeiro e erros \(e_x\) e \(e_y\) independentes de \(T\) e entre si. Então
Contra \(x\), a diferença sempre tem uma tendência para baixo, mesmo sem defeito nenhum na ferramenta. Contra a média, a tendência some quando os dois erram igual, e só aparece quando um dos métodos é de fato mais ruidoso.
O viés e os limites são estimativas e têm intervalo. O do viés é \(\bar d \pm t\, s_d/\sqrt{n}\), com \(t\) de Student e \(n-1\) graus de liberdade. O de cada limite usa a variância aproximada de Bland e Altman [1], retomada no artigo de 1999 [2]:
A primeira parcela vem de \(\bar d\), e a segunda de \(s_d\), cuja variância é cerca de \(s_d^2/(2(n-1))\) para dados normais. Com \(n\) placas, cada limite fica conhecido a \(\pm t\sqrt{3/n}\, s_d\). Numa simulação com diferenças normais, esse intervalo contém o limite verdadeiro em 94,2% das vezes com 30 placas e em 94,7% com 100. É essa conta que decide o tamanho do estudo, na seção Quantas placas.
Quando a dispersão cresce com a contagem
Em contagem, o erro raramente é o mesmo numa placa de 50 sementes e numa de 500. Placas densas têm mais sementes encostadas, e cada par que não se separa tira uma semente da contagem. No gráfico de Bland-Altman isso aparece como um funil: a nuvem de diferenças abre conforme a média cresce, e os limites calculados com um único \(s_d\) ficam largos demais nas placas pequenas e estreitos demais nas grandes.
A saída mais simples é trocar a diferença pela razão, tirando logaritmos antes de subtrair. Com \(d_i = \ln y_i - \ln x_i = \ln(y_i/x_i)\), o viés e os limites se calculam como antes e voltam para a escala original pela exponencial [2]:
O resultado se lê como razão: em 95% das placas, a ferramenta conta entre, digamos, 0,96 e 1,02 vez o que o analista conta. Se o erro é proporcional à contagem, a nuvem em escala log fica com largura constante, e um só par de limites vale para todas as placas. Quando o funil não é proporcional, por exemplo um erro que cresce com a raiz da contagem, como numa contagem de Poisson, Bland e Altman [2] também mostram como modelar o desvio das diferenças em função da média. No gerador de pares, o controle de dependência da contagem cria o funil, e a escala de razão o desfaz quando o erro é proporcional.
Lin: concordância com a reta y = x
O coeficiente de correlação de Pearson mede quanto os pontos se alinham numa reta qualquer. Uma ferramenta que conta sempre 10% a mais que o analista tem \(r = 1\) e erra 10% em toda placa. E \(r\) cresce com a amplitude da amostra: com o mesmo erro, placas de 20 a 800 sementes dão \(r\) maior que placas de 180 a 220. Por isso Bland e Altman [1] descartaram a correlação como medida de concordância.
Lin [3] mediu a distância à reta \(y = x\), e não a uma reta qualquer. O desvio quadrático médio entre as leituras se decompõe em
e o coeficiente de correlação de concordância (CCC) compara esse desvio com o que haveria se \(x\) e \(y\) fossem independentes, com as mesmas médias e variâncias.
Resultado: o CCC e a sua decomposição
Demonstração. A primeira igualdade é a definição, e a segunda sai de (5). Para a terceira, escreva \(\sigma_{xy} = \rho\,\sigma_x\sigma_y\) e divida numerador e denominador por \(\sigma_x\sigma_y\).
\(\rho\) é a precisão, quanto os pontos se espalham em torno da melhor reta, e \(C_b\), entre 0 e 1, é a exatidão, quanto essa reta se afasta de \(y = x\) por deslocamento (\(u\)) ou por escala (\(v\)). O CCC só chega a 1 se os pontos caem sobre \(y = x\). Lin estimou médias, variâncias e covariância com denominador \(n\) e trabalhou na escala da tangente hiperbólica inversa (a transformação \(z\) de Fisher) para o intervalo. Uma reamostragem das placas (bootstrap) dá um intervalo equivalente sem fórmula, e é o que o gerador usa.
O CCC herda um defeito do \(r\): também cresce com a amplitude das contagens. Ele complementa os limites de Bland-Altman, não os substitui.
κ: a classe de cada semente
Na leitura de tetrazólio, a pergunta por semente é de classe: viável, inviável ou vazia. A concordância observada \(p_o\), a fração de sementes em que as duas leituras coincidem, engana porque parte dela vem do acaso. Se 80% das sementes são viáveis, dois leitores que chutam "viável" nessa proporção, sem olhar, concordam em 68% das sementes (\(0{,}8^2 + 0{,}2^2\)). Cohen [4] descontou essa parte:
com \(p_{k\cdot}\) e \(p_{\cdot k}\) as frações da classe \(k\) em cada leitura. \(p_e\) é a concordância esperada se as duas leituras fossem independentes, com as marginais observadas. \(\kappa = 1\) é concordância perfeita e \(\kappa = 0\) é o acaso.
| consenso: viável | consenso: inviável | total | |
|---|---|---|---|
| ferramenta: viável | 300 | 18 | 318 |
| ferramenta: inviável | 12 | 70 | 82 |
| total | 312 | 88 | 400 |
Aqui \(p_o = 370/400 = 0{,}925\), \(p_e = (318 \cdot 312 + 82 \cdot 88)/400^2 = 0{,}665\) e \(\kappa = 0{,}776\). A mesma tabela dá a sensibilidade para inviável, \(s = 70/88 = 0{,}795\), e a especificidade, \(e = 300/312 = 0{,}962\). São o \(s\) e o \(e\) da correção de Rogan-Gladen, com que a contagem da ferramenta se corrige.
Com \(m\) analistas lendo as mesmas \(N\) sementes, Fleiss [5] generalizou a conta. Para a semente \(i\), com \(n_{ij}\) analistas pondo-a na classe \(j\):
com \(\bar P\) a média dos \(P_i\). \(P_i\) é a fração dos pares de analistas que concordam na semente \(i\), e o acaso usa as marginais de todos os analistas juntos.
Dois cuidados. Primeiro, \(\kappa\) depende da prevalência da classe. O mesmo classificador, com \(s = 0{,}80\) e \(e = 0{,}98\), tem \(\kappa = 0{,}82\) num lote com 30% de inviáveis e \(\kappa = 0{,}56\) num lote com 2%, embora a concordância bruta suba de 92,6% para 97,6%. Feinstein e Cicchetti [6] descreveram esse paradoxo, e por isso \(\kappa\) sai sempre ao lado da matriz de confusão e da sensibilidade e especificidade por classe, com a classe inviável e a fronteira de coloração fraca relatadas à parte. As faixas verbais de Landis e Koch [7], como "substancial" para 0,61 a 0,80, são uma convenção dos autores, não um teste.
Segundo, as sementes de uma mesma placa não são independentes: um problema de luz ou de foco atinge todas. O intervalo de \(\kappa\) precisa reamostrar placas, não sementes, e milhares de sementes de poucas placas valem como poucas placas, pelo mesmo efeito de delineamento da página de proporções.
ICC de concordância absoluta
Para uma medida contínua lida por \(k\) leitores nas mesmas \(n\) placas, o modelo de dois fatores separa a placa, o leitor e o resto:
\(a_i\) é a diferença real entre placas, \(b_j\) o desvio sistemático do leitor \(j\) (a ferramenta é um dos leitores) e \(e_{ij}\) o erro. O ICC de concordância absoluta é a fração da variância total que vem das placas:
É o ICC(2,1) de Shrout e Fleiss [8], ou ICC(A,1) na notação de McGraw e Wong [9]. \(MS_R\) é o quadrado médio das placas, \(MS_C\) o dos leitores e \(MS_E\) o residual, todos da análise de variância de dois fatores sem repetição. A versão de consistência, ICC(3,1) ou ICC(C,1), tira o termo dos leitores do denominador e fica cega a um viés constante; para comparar métodos, é a escolha errada. Há dez formas de ICC, e o relato precisa dizer qual foi usada [10].
Como o CCC, o ICC é uma razão de variâncias e cresce com a variação entre placas, com o mesmo erro. Com dois leitores, os dois coeficientes ficam numericamente muito próximos, e o gerador mostra os dois lado a lado.
O critério: não pior que um segundo analista
Se dois analistas treinados podem discordar dentro da tolerância, a régua da ferramenta é essa discordância, e não um rótulo único. O critério de não inferioridade fixa uma margem \(\delta\) antes da coleta e pede que a discordância entre ferramenta e analista não passe da discordância entre analistas por mais que \(\delta\).
Uma forma de pôr o critério em número usa as duas diferenças nas mesmas placas: \(D_{FA}\), ferramenta menos analista A, e \(D_{AA}\), analista B menos analista A. Para cada uma, a amplitude de concordância \(\mathcal{A} = |\bar d| + 1{,}96\, s_d\) é a distância entre zero e o limite mais afastado dele: do lado pior, só 2,5% das placas passam dessa distância. A razão
vale 1 quando a ferramenta, posta no lugar do analista B, discorda de A exatamente como B discordava.
Critério
A ferramenta é não inferior a um segundo analista se o limite superior do intervalo de 90% de \(\theta\) (unilateral de 95%) fica abaixo de \(1 + \delta\). É inferior se o limite inferior passa de \(1 + \delta\). Entre os dois, o estudo é inconclusivo: a resposta pede mais placas.
As duas diferenças têm o analista A em comum e não são independentes. O intervalo de \(\theta\) sai da reamostragem das placas: sorteiam-se placas com reposição e as duas amplitudes se recalculam juntas, preservando o pareamento. Com três ou mais analistas, a conta se repete para cada par. A margem \(\delta\) tem de vir de fora dos dados, do que a norma tolera entre repetições ou do que o laboratório considera uma diferença sem consequência. Fixada depois de ver os resultados, ela decide o resultado.
Instrumento · gerador de pares, ferramenta contra analista Simulação
Os ruídos são o desvio-padrão, em porcentagem da contagem, numa placa típica de 155 sementes. Com dependência 0 o erro tem o mesmo tamanho em sementes em toda placa; com 1 ele cresce na proporção da contagem; 0,5 é o meio-termo de uma contagem de Poisson.
–
Bland-Altman: ferramenta menos analista A
placasviéslimites, com IC de 95%limites entre analistas
Ferramenta contra analista A tracejado: y = x
Cada placa tem uma contagem verdadeira sorteada entre 40 e 600 sementes. Os analistas A e B erram sem viés, com o ruído escolhido; a ferramenta erra com o viés e o ruído escolhidos. A dependência da contagem vale para todos. O intervalo de \(\theta\) e o do CCC saem de 1.000 reamostragens das placas. Repare que CCC, ICC e \(r\) ficam perto de 1 com qualquer ajuste razoável, porque a faixa de contagens é larga; os limites dizem quantas sementes separam as leituras.
Quantas placas: a precisão dos limites
Pela equação (3), a meia-largura do intervalo de 95% de cada limite de concordância, em unidades de \(s_d\), depende só de \(n\): vale \(t_{0{,}975;\,n-1}\sqrt{1/n + 1{,}96^2/(2(n-1))}\). A do viés é \(t/\sqrt{n}\). A tabela recalcula as duas para os tamanhos de estudo mais comuns, junto com a forma curta \(t\sqrt{3/n}\).
| placas, n | \(t_{0{,}975;\,n-1}\) | cada limite | forma curta \(t\sqrt{3/n}\) | viés |
|---|---|---|---|---|
| 30 | 2,045 | ±0,645 | ±0,647 | ±0,373 |
| 50 | 2,010 | ±0,489 | ±0,492 | ±0,284 |
| 100 | 1,984 | ±0,340 | ±0,344 | ±0,198 |
| 200 | 1,972 | ±0,239 | ±0,242 | ±0,139 |
Com 100 placas, cada limite fica conhecido a cerca de um terço de \(s_d\); com 30, a quase dois terços. Ir de 100 para 200 placas só tira um décimo de \(s_d\). O ganho cai com a raiz de \(n\), e o tamanho do estudo sai da largura aceitável para os limites, não do hábito. Lu e colaboradores [11] dão uma conta mais completa, que fixa também a probabilidade de o intervalo dos limites ficar dentro de uma diferença máxima definida antes do estudo.
Para \(\kappa\) por semente, o número de sementes chega fácil aos milhares. A restrição real é o número de placas e de sessões independentes.
Repetibilidade e reprodutibilidade entre operadores
Concordância com o analista responde se a ferramenta lê como as pessoas. Repetibilidade e reprodutibilidade respondem outra coisa: quanto a leitura muda quando se repete. O delineamento típico tem várias placas, três ou mais operadores e duas sessões por operador, com intervalo de dias, ordem sorteada e sem acesso à leitura anterior. O modelo misto
com placa \(P_i\), operador \(O_j\), a interação placa × operador e o erro da sessão \(e_{ijk}\), todos aleatórios, separa duas variâncias. A de repetibilidade, \(\sigma_r^2 = \sigma_e^2\), é a variação do mesmo operador lendo a mesma placa de novo. A de reprodutibilidade, \(\sigma_R^2 = \sigma_O^2 + \sigma_{PO}^2 + \sigma_e^2\), soma a variação entre operadores. A convenção da norma ISO 5725 [12] traduz cada uma num limite: a diferença entre duas leituras independentes fica abaixo de \(1{,}96\sqrt{2}\,\sigma \approx 2{,}8\,\sigma\) em 95% dos casos, porque a diferença de duas leituras tem desvio \(\sqrt{2}\,\sigma\).
No modo assistido o operador é parte do método: a mesma placa conferida por duas pessoas pode dar contagens diferentes, e essa diferença é a reprodutibilidade do método assistido. Vale medir também a reaquisição, com a mesma placa digitalizada de novo, reposicionada, três vezes: ela mede a variação da imagem, que o operador não controla. E o mesmo desenho aplicado ao método manual de referência dá as variâncias com que as da ferramenta se comparam.
O que a norma pede
O documento de validação de métodos da ISTA [13] pede repetibilidade dentro do laboratório, reprodutibilidade entre laboratórios e comparação com o método existente, quando ele existe. Para um método validado em vários laboratórios, o mínimo são 6 a 8 laboratórios colaboradores; com 2 a 6, a validação é entre pares. As amostras vão codificadas às cegas para quem executa o teste, e cada laboratório recebe pelo menos duas amostras de cada nível, porque são as repetições que permitem calcular repetibilidade e reprodutibilidade. Os níveis cobrem a faixa de uso, com pelo menos um baixo, um intermediário e um alto. Para a incerteza, a norma prefere o caminho das tabelas de tolerância, o mesmo das Regras para Análise de Sementes.
O ponto é que a norma não pede acurácia contra um rótulo. Pede repetibilidade, reprodutibilidade e incerteza comparáveis às do método de referência, medidas com amostras cegas e repetições. O critério de não inferioridade a um segundo analista é a tradução direta disso para uma ferramenta de contagem.
No SeedCounter
No SeedCounter
Para um estudo de concordância, use uma única versão do app durante toda a coleta e anote qual foi. Conte cada placa sem ver a leitura dos analistas e declare o modo de cada contagem. No assistido, a máquina propõe o contorno e a classe e a pessoa confere cada semente, que é o modo que o produto defende; o automático, sem conferência, mostra o que a conferência corrige. Guarde a contagem e a classe de cada semente por placa: a contagem alimenta o Bland-Altman, e a classe semente a semente alimenta o \(\kappa\) e o \(s\) e \(e\) da correção de Rogan-Gladen.
Onde falha
Os limites de Bland-Altman supõem diferenças independentes entre placas e com distribuição perto da normal. Placas da mesma sessão ou do mesmo lote podem errar juntas, e os limites valem só para a faixa de contagens e de densidades do estudo. CCC e ICC crescem com a amplitude da amostra, e um estudo só com placas fáceis infla os dois. \(\kappa\) cai com classe rara sem que a leitura piore. O consenso dos analistas não é a verdade: onde especialistas discordam, como na coloração fraca, nenhum critério separa erro da ferramenta de dúvida legítima, e essa fronteira se relata à parte. E a não inferioridade depende de \(\delta\), que é uma decisão, não uma estatística.
Dados
Esta página não usa leitura real de analista. O gerador sorteia contagens verdadeiras e leituras com os erros escolhidos nos controles, no seu navegador, e os números mudam a cada sorteio. A tabela de tamanho de amostra e os exemplos de \(\kappa\) são contas exatas; o script que as refaz está no código do site.
Referências
- Bland J.M., Altman D.G. (1986). Statistical methods for assessing agreement between two methods of clinical measurement. The Lancet 327(8476), 307–310. doi:10.1016/S0140-6736(86)90837-8
- Bland J.M., Altman D.G. (1999). Measuring agreement in method comparison studies. Statistical Methods in Medical Research 8(2), 135–160. doi:10.1177/096228029900800204
- Lin L.I.-K. (1989). A concordance correlation coefficient to evaluate reproducibility. Biometrics 45(1), 255–268. doi:10.2307/2532051
- Cohen J. (1960). A coefficient of agreement for nominal scales. Educational and Psychological Measurement 20(1), 37–46. doi:10.1177/001316446002000104
- Fleiss J.L. (1971). Measuring nominal scale agreement among many raters. Psychological Bulletin 76(5), 378–382. doi:10.1037/h0031619
- Feinstein A.R., Cicchetti D.V. (1990). High agreement but low kappa: I. The problems of two paradoxes. Journal of Clinical Epidemiology 43(6), 543–549. doi:10.1016/0895-4356(90)90158-L
- Landis J.R., Koch G.G. (1977). The measurement of observer agreement for categorical data. Biometrics 33(1), 159–174. doi:10.2307/2529310
- Shrout P.E., Fleiss J.L. (1979). Intraclass correlations: uses in assessing rater reliability. Psychological Bulletin 86(2), 420–428. doi:10.1037/0033-2909.86.2.420
- McGraw K.O., Wong S.P. (1996). Forming inferences about some intraclass correlation coefficients. Psychological Methods 1(1), 30–46. doi:10.1037/1082-989X.1.1.30
- Koo T.K., Li M.Y. (2016). A guideline of selecting and reporting intraclass correlation coefficients for reliability research. Journal of Chiropractic Medicine 15(2), 155–163. doi:10.1016/j.jcm.2016.02.012
- Lu M.-J., Zhong W.-H., Liu Y.-X., Miao H.-Z., Li Y.-C., Ji M.-H. (2016). Sample size for assessing agreement between two methods of measurement by Bland-Altman method. The International Journal of Biostatistics 12(2), 20150039. doi:10.1515/ijb-2015-0039
- ISO 5725-6:1994. Accuracy (trueness and precision) of measurement methods and results, Part 6: Use in practice of accuracy values. Norma internacional ISO.
- ISTA (2006). TCOM-P-01: ISTA Method Validation for Seed Testing, versão 2.0. Norma de validação de métodos da ISTA. seedtest.org, Method Validation Programme
A máquina propõe, a pessoa confere, a concordância mede.
O SeedCounter conta e classifica semente por semente no navegador, e cada semente passa pela conferência de quem conta.