Whoop, Oura, Garmin y Apple Watch miden la misma noche y dan números distintos

Una mano humana con múltiples dispositivos portátiles en una habitación borrosa. Hay un reloj inteligente con una esfera analógica, un rastreador de ejercicios con una pantalla digital, un rastreador de sueño con un sensor verde brillante, y dos anillos inteligentes con sensores brillantes.

Ponte un Oura Ring 5 en el dedo, un Whoop 5.0 en la muñeca y un Apple Watch Series 11 en la otra, y la misma noche te devolverá tres respuestas distintas. Uno dirá 7 horas 12 minutos, otro 6 horas 48, y el tercero repartirá tus fases de sueño de una forma que no coincide con ninguno de los otros dos.

Ninguno miente. Lo que ocurre es que dos de esos tres números no son mediciones: son estimaciones calculadas por algoritmos distintos, sobre señales capturadas en puntos del cuerpo con propiedades ópticas distintas, comparadas contra líneas base construidas en ventanas de tiempo distintas.

Esta guía separa lo que estos dispositivos miden de lo que infieren, con las cifras de los estudios que los compararon contra electrocardiograma y polisomnografía.

Puntos Clave

  • La frecuencia cardiaca nocturna y la variabilidad (VFC) sí están validadas. Contra electrocardiograma, los mejores dispositivos quedan dentro de ±1.1 lpm en frecuencia en reposo y ±3.6 ms en VFC. Ese dato es utilizable.
  • Las fases del sueño y las calorías no lo están. La concordancia al clasificar fases específicas cae al rango de 50% a 65%, y ningún dispositivo medido en laboratorio ha bajado del 20% de error en gasto energético.
  • Ningún dispositivo de 2026 tiene validación independiente todavía. Las cifras que circulan pertenecen a las generaciones anteriores del mismo hardware, y el desfase entre lo que compras y lo que se ha medido es de dos a tres años.

Por qué el dedo lee mejor que la muñeca: la física de la señal óptica

Todos usan la misma técnica: fotopletismografía (PPG). Un LED ilumina la piel, un fotodetector mide cuánta luz regresa, y la fracción pulsátil de esa señal reproduce el cambio de volumen sanguíneo con cada latido.

La relación entre componente pulsátil y constante se llama índice de perfusión, y determina si hay señal suficiente para trabajar.

La ventaja anatómica del dedo

Ahí el sitio de medición deja de ser un detalle de diseño. Un estudio que registró PPG en seis puntos del cuerpo (dedo, muñeca ventral, muñeca dorsal, brazo, lóbulo de la oreja y frente) encontró que la amplitud media desde el dedo fue significativamente mayor que la de los otros cinco sitios (p menor a 0.001), además del porcentaje más alto de ondas analizables.

Dos razones anatómicas lo explican: la piel del dedo es más delgada, así que atenúa menos luz antes de llegar al lecho capilar, y la mano tiene una perfusión basal muy superior a la del tronco y las extremidades.

Oura convirtió eso en argumento comercial con el Ring 5: afirma obtener una señal de pulso hasta 100 veces más fuerte que la de un wearable de muñeca. La dirección del argumento es correcta y la evidencia revisada por pares la respalda. La magnitud es una cifra de marca sin publicación que la sostenga, y conviene leerla así.

Por qué la muñeca mide mejor de noche

La muñeca no es un mal sitio. Es un sitio con menos margen. Un análisis sobre 1,142 sujetos midió la relación señal a ruido del PPG de muñeca según la postura: 18.6 dB acostado boca arriba, 13.7 dB sentado con el brazo apoyado, y 9.0 dB de pie con el brazo colgando.

La lectura de tu reloj es más limpia cuando estás dormido que en cualquier otro momento del día, y por eso todas las marcas construyen sus métricas de recuperación con datos nocturnos.

Whoop atacó el problema por dos vías en la generación 5.0: subió el muestreo del sensor a 26 Hz y mantiene su línea de prendas técnicas que permiten llevar el sensor en el bíceps en lugar de la muñeca. Si quieres el detalle de qué sensor hace qué dentro del dispositivo, lo desglosamos en nuestra comparativa de sensores ópticos frente a bioimpedancia.

Lo que sí miden y lo que estiman: FC, VFC y temperatura vs. fases del sueño y calorías

Hay una frontera clara dentro de la app que ningún fabricante dibuja para ti.

Del lado medido están la frecuencia cardiaca, los intervalos entre latidos de los que sale la VFC, y la temperatura cutánea. Son magnitudes que el sensor deriva de la forma de onda con procesamiento acotado.

Del lado estimado están las fases del sueño, el gasto calórico y cualquier puntaje compuesto (Recovery, Readiness, Body Battery).

Aquí el dispositivo no mide sueño profundo: infiere sueño profundo a partir de la regularidad del ritmo cardiaco, la respiración y el movimiento, con un modelo entrenado sobre poblaciones que probablemente no se parecen a ti.

La tabla que ordena la discusión

MétricaCómo se obtieneValidación publicadaUtilidad real
Frecuencia cardiaca en reposo nocturnaMedidaCCC 0.91 a 0.98 vs ECG; error 1.7% a 3.0%Alta: usable a nivel individual
VFC nocturna (rMSSD)MedidaCCC 0.82 a 0.99 vs ECG; error 6% a 16%Alta como tendencia, no como valor absoluto
Sueño total (dormido vs despierto)Estimada86% a 89% de concordancia vs polisomnografíaMedia: sirve para duración
Fases del sueño (ligero, profundo, REM)Estimada50% a 65% de concordancia vs polisomnografíaBaja: no tomes decisiones con esto
Vigilia dentro de la nocheEstimadaSensibilidad tan baja como 23% en algunos relojesMuy baja: sobreestima el sueño
Gasto calóricoEstimadaNingún dispositivo bajó de 20% de errorMuy baja: no la uses para dieta

Las cifras cardiacas provienen de un estudio publicado en Physiological Reports que registró 536 noches con electrocardiograma de referencia simultáneo. Las de sueño combinan una validación multicéntrica de 11 rastreadores en JMIR mHealth con 349,114 épocas analizadas y un estudio de seis dispositivos contra polisomnografía en Sensors.

El desfase de validación: compras un Ring 5 y lees cifras de un Gen 4

Este es el punto que ninguna comparativa menciona y que cambia cómo debes leer todo lo anterior. La ciencia de validación va dos o tres generaciones detrás del catálogo.

Lo que puedes comprar hoyLanzamientoGeneración con validación independiente
Oura Ring 54 de junio de 2026Gen 3 y Gen 4
Whoop 5.0 y Whoop MGMayo de 2025Whoop 3.0 y 4.0
Garmin CIRQA21 de julio de 2026Ninguna (Fenix 6 y Vivosmart 4 en otros modelos)
Apple Watch Series 11Septiembre de 2025Series 6 y Series 8

El Oura Ring 5 es el caso más claro. Llegó el 4 de junio de 2026 con un cuerpo 40% más pequeño que el Ring 4, sensores de perfil bajo y 12 vías de señal diseñadas específicamente para dar lecturas consistentes en distintos dedos y tonos de piel.

Nada de eso está evaluado por terceros todavía: las cifras que verás citadas en cualquier artículo, incluido este, corresponden al Gen 3 y al Gen 4. El salto generacional lo analizamos aparte en Oura Ring 5 vs Oura Ring 4.

La Garmin CIRQA, que llegó a México en $4,199 MXN, es el extremo opuesto: una categoría nueva para la marca, sin ningún estudio independiente sobre ese hardware específico.

Esto no invalida las cifras. Los principios de medición no cambian entre generaciones: el dedo sigue teniendo mejor perfusión que la muñeca, la vigilia quieta sigue siendo difícil de distinguir del sueño ligero, y el gasto calórico sigue siendo una inferencia. Lo que sí cambia es la magnitud del error, y esa parte todavía nadie la ha medido en el hardware de 2026.

Las tres métricas con validación seria (y las dos en las que ningún dispositivo es confiable)

Las tres que aguantan escrutinio

Frecuencia cardiaca en reposo nocturna. En el estudio de 536 noches, el Oura Gen 3 registró un error porcentual medio de 1.67% y el Gen 4 de 1.94%. Whoop 4.0 quedó en 3.00%. Sobre una frecuencia de 55 lpm eso son desviaciones de 0.9 a 1.6 latidos. El Garmin Fenix 6 fue excluido de este análisis por inconsistencias metodológicas en cómo reporta el dato, lo cual es en sí mismo un hallazgo.

VFC nocturna. Oura Gen 4 alcanzó una concordancia de 0.99 contra ECG, Gen 3 llegó a 0.97, Whoop 4.0 a 0.94, Garmin Fenix 6 a 0.87 y Polar Grit X Pro a 0.82. La ventaja del anillo no es de software: es de sitio de medición.

Duración total del sueño. Distinguir dormido de despierto es la tarea más sencilla y todos la resuelven razonablemente, con concordancias de 86% a 89%.

Las dos que no

La arquitectura del sueño. Al pedirles que clasifiquen la fase específica, la concordancia se desploma. Apple Watch quedó en 53%, Garmin en 50%, Polar en 51%, Oura en 61% y Whoop en 60%. El problema mayor está en detectar vigilia: en la validación multicéntrica, un reloj tope de gama identificó apenas el 23% de los minutos en que el sujeto estaba realmente despierto.

Los dispositivos de muñeca clasifican esa vigilia como sueño ligero de forma sistemática, y el resultado es una eficiencia de sueño inflada hasta en 12.8 puntos porcentuales, equivalente a contar 54 minutos de vigilia como sueño en una noche de siete horas en cama.

El gasto calórico. En el estudio de Stanford con 60 voluntarios, seis de siete dispositivos lograron menos de 5% de error en frecuencia cardiaca durante ciclismo. Ninguno bajó del 20% en gasto energético. El error creció además con el índice de masa corporal y con tonos de piel más oscuros, un dato con implicación directa para la población mexicana.

Que Oura haya diseñado el Ring 5 con 12 vías de señal para tonos de piel distintos sugiere que la industria por fin reconoció el problema. La metodología completa está publicada en el Journal of Personalized Medicine.

El techo que nadie menciona: ni la polisomnografía es perfecta

Hay un dato que reordena toda la conversación sobre precisión. Cuando dos técnicos humanos certificados puntúan por separado la misma noche de polisomnografía, coinciden alrededor del 83% del tiempo.

Es decir: el estándar de oro contra el que se mide a estos dispositivos tiene su propio margen de desacuerdo de casi uno de cada seis fragmentos de la noche. Un wearable que alcanzara 90% de concordancia con un técnico estaría, por definición, en desacuerdo con el otro técnico.

Esto tiene dos consecuencias prácticas. La primera es que un dispositivo perfecto es imposible, porque la referencia no es única. La segunda es que la distancia entre el mejor wearable y el techo real es menor de lo que sugiere el número crudo.

Aquí conviene una advertencia de lectura. Un estudio del Brigham and Women’s Hospital reportó que el algoritmo de Oura alcanzó 79% de concordancia en clasificación de cuatro fases, con una sensibilidad de sueño profundo de 79.5% frente a 61.7% del Fitbit Sense 2 y 50.5% del Apple Watch Series 8.

Ese estudio fue financiado por Oura y su autora principal figura como asesora médica de la marca. Un trabajo independiente posterior, que no incluyó Oura, midió sensibilidades de sueño profundo muy distintas: 69.6% para Whoop 4.0, 50.7% para Apple Watch y 32.1% para un Garmin Vivosmart 4. Cuando el patrocinador cambia, el ranking cambia. Léelo con esa lente.

Por qué tu puntaje de recuperación no es comparable con el de otra persona

Ningún puntaje de recuperación es una medición. Es una posición relativa: qué tan lejos está tu noche de anoche respecto a tu propio promedio histórico.

Whoop lo documenta explícitamente. La primera vez que registras un sueño, tus datos se comparan contra valores típicos por edad, sexo y nivel de condición física. Solo después de cuatro recuperaciones consecutivas el puntaje se considera calibrado a tu fisiología, y a partir de ahí opera sobre un promedio ponderado de 28 días.

Oura hace algo estructuralmente parecido pero con una asimetría interesante: su contribuidor de temperatura corporal solo puede bajar tu Readiness Score, nunca subirlo. Es un detector de anomalías, no un premio por dormir bien.

Esto tiene una consecuencia práctica que se ignora en cada conversación de gimnasio. Un rMSSD de 45 ms puede ser un valor excelente para una persona y una señal de alarma para otra, porque el rango absoluto de VFC varía enormemente entre individuos sanos por genética, edad y estructura cardiaca. Comparar tu 68% de recuperación contra el 91% de alguien más no significa nada. Ambos números están expresados en escalas personales que no comparten origen.

La elección de formato influye en qué tan estable es esa línea base, algo que abordamos en el análisis de smartwatches frente a anillos inteligentes.

Ventana de cálculo: por qué Garmin reacciona lento y Whoop reacciona rápido

Esta es la fuente de confusión más común entre quienes cambian de dispositivo, y no tiene nada que ver con precisión.

Garmin reporta, en su estado de VFC, un promedio móvil de siete días comparado contra tu rango personal. El número que ves no es lo de anoche: es la última semana. Por diseño, una noche mala apenas mueve la aguja, y una racha de tres noches malas tarda en aparecer.

Whoop reporta lo contrario: un puntaje diario de la noche anterior, contrastado contra una línea base ponderada que privilegia lo reciente. Una noche con alcohol se refleja a la mañana siguiente con toda su fuerza.

Oura se ubica en medio y varía según la métrica: su tendencia de temperatura usa una ventana ponderada de tres días, mientras su calificación de VFC compara los últimos siete días contra tu promedio de largo plazo.

Apple Watch no publica un puntaje compuesto. La app Salud clasifica cada métrica nocturna como típica o atípica frente a tu rango, sin agregarlas en una cifra única. El Series 12 que se espera en septiembre no parece cambiar ese enfoque.

Ninguna de estas decisiones es un error. Son productos que responden preguntas diferentes: Garmin responde cómo vengo, Whoop responde cómo amanecí. Si migraste de uno a otro y sentiste que el nuevo dispositivo era errático o insensible, lo que cambió fue la ventana, no el sensor. Ese contraste de filosofías lo desarrollamos en la comparativa de Garmin CIRQA frente a Whoop 5.0.

Cuánto tarda cada dispositivo en construir tu línea base

Los datos de tu primera semana son, en la práctica, inservibles. Cada fabricante publica su periodo de calibración y las diferencias son grandes.

DispositivoCalibración mínimaVentana de referenciaDocumentación oficial
Whoop 5.0 y MG4 recuperaciones consecutivasPromedio ponderado de 28 díasSoporte Whoop
Oura Ring 5Primeras dos semanas (temperatura)3 días (temperatura), 7 días (VFC)Soporte Oura
Garmin (CIRQA y relojes)Aproximadamente 3 semanasPromedio móvil de 7 díasBlog oficial Garmin
Apple Watch Series 117 nochesRango típico personalSoporte Apple

Garmin añade una condición que casi nadie cumple: recomienda usar el dispositivo al menos cuatro noches por semana para que la línea base tenga sentido. Uno que solo llevas puesto de lunes a viernes construye una referencia sesgada hacia tus noches laborales.

Hay una trampa adicional. Si estrenaste el dispositivo durante vacaciones o una semana de descanso, tu línea base quedó anclada en un estado atípicamente bueno, y durante las semanas siguientes el aparato te dirá que estás peor de lo que estás. La solución no es reiniciar nada: es esperar. Las líneas base son dinámicas y se recalibran solas.

Cómo leer una tendencia de 7 días en lugar de obsesionarte con el número de hoy

Aquí es donde los márgenes de error dejan de ser trivia académica y se vuelven una regla de uso.

Toma un rMSSD de referencia de 60 ms. Con el error porcentual medio publicado, un Oura lo reportaría en algún punto entre 56 y 64 ms, un Whoop entre 55 y 65 ms, y un Garmin entre 54 y 66 ms. Nada ha cambiado en tu cuerpo: ese es el ruido del instrumento.

Súmale la variabilidad biológica normal. Un seguimiento de 16 semanas en atletas de élite encontró un coeficiente de variación semanal de 5.4% en la VFC logarítmica, es decir, oscilación diaria sin causa identificable.

Combinando ambas fuentes de ruido, el cambio mínimo interpretable sobre esos 60 ms ronda los 5 ms en un Oura, 6 ms en un Whoop y 7 ms en un Garmin. Cualquier variación por debajo de ese umbral en una sola noche no es información.

La regla operativa que se desprende de esto es simple:

  • Un día es un dato. No accionable por sí solo.
  • Tres días en la misma dirección son un patrón. Vale la pena revisar sueño, carga y alcohol.
  • Siete días sostenidos fuera de tu rango son una señal. Ajusta o consulta.

Sobre cómo se ve esa disciplina de lectura aplicada durante un año completo, documentamos la experiencia en 320 días usando Whoop 5.0.

El error de usar dos wearables a la vez esperando que coincidan

Es la prueba casera favorita del comprador escéptico: anillo en el dedo, banda en la muñeca, y a ver quién gana. La prueba está mal diseñada desde el planteamiento.

Los dos dispositivos capturan la señal en sitios con perfusión y grosor de piel distintos, definen la ventana de sueño con criterios distintos, promedian sobre intervalos distintos y comparan contra líneas base construidas en periodos distintos. Que coincidan sería la anomalía.

Hay un detalle metodológico revelador en la validación multicéntrica de 11 rastreadores: los investigadores tuvieron que dividir los dispositivos en dos grupos porque los aparatos que comparten tipo de señal interfieren entre sí, y limitaron a un máximo de dos relojes por participante, uno en cada muñeca. Si tú te pones dos dispositivos en el mismo brazo, estás degradando ambas lecturas.

Lo que sí funciona es elegir un dispositivo y quedarte con él el tiempo suficiente para que su línea base madure. La consistencia interna vale más que la precisión absoluta cuando lo que te interesa es detectar cambios en ti mismo.

Si aún estás en la fase de elección, la comparativa entre Garmin CIRQA, Oura Ring 5 y Whoop 5.0 ordena las tres filosofías de cobro y de formato.

Un último punto con peso específico en México. Las funciones reguladas como el ECG del Whoop MG o las notificaciones de ritmo irregular dependen de aprobación sanitaria país por país, y la propia Whoop mantiene una página de disponibilidad por región precisamente porque no están activas en todos lados.

Antes de pagar por la membresía más cara verifica que la función que te interesa exista en tu país. Para el criterio de compra con precios locales, la referencia es nuestra guía de mejores wearables de salud 2026.

Preguntas Frecuentes

¿Cuál de los wearables de 2026 es el más preciso?

Ninguno tiene validación independiente todavía, así que la respuesta se apoya en las generaciones anteriores: los anillos Oura lideran en frecuencia cardiaca y VFC nocturnas por una ventaja física del sitio de medición. Para fases del sueño ningún dispositivo alcanza precisión suficiente como para decidir nada con ese dato.

¿Por qué mi reloj dice que dormí más de lo que sentí?

Porque los dispositivos de muñeca clasifican como sueño ligero los periodos en que estás despierto pero quieto. La sensibilidad para detectar vigilia dentro de la noche llega a ser tan baja como 23% en algunos modelos.

¿Sirve de algo el contador de calorías?

Como referencia relativa entre tus propios días, marginalmente. Como cifra absoluta para planear una dieta, no: ningún dispositivo evaluado en laboratorio ha bajado del 20% de error en gasto energético.

¿Cuánto tiempo debo usarlo antes de tomar decisiones con sus datos?

Entre una semana con Apple Watch y tres semanas con Garmin, según el fabricante. Antes de ese plazo el dispositivo aún te está comparando contra promedios poblacionales y no contra ti.

Dejar un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *