DWPose
Evalúa DWPose como preprocesador de pose: separa detección, mapeo de puntos clave, mapas dibujados y generación posterior antes de juzgar un flujo de referencia de personajes.
Identidad y acceso
- Nombre del modelo
- DWPose
- Acceso
- La rama ONNX oficial documenta vías de código y archivos de modelo separados. Usa los materiales oficiales revisados, sin suponer que una réplica tiene el mismo contenido o licencia.
- Tipo de modelo
- CNN + Transformer
- Arquitectura
- Estimación de pose del cuerpo entero basada en RTMPose
- Público objetivo
- Artistas técnicos y desarrolladores que necesitan una etapa de preprocesamiento de pose cuyos fallos puedan diagnosticar antes de generar imágenes.
- Entrada
- Una imagen de referencia para detectar personas y estimar la pose del cuerpo entero, junto con la pareja exacta de checkpoints de detección y pose de la vía elegida.
- Salida
- Coordenadas brutas de pose y, en la integración revisada, un mapa dibujado de cuerpo, manos y cara para el flujo posterior.
- Coste
- Mide detección de personas, estimación de pose y dibujo por separado de la generación posterior y la corrección manual. Aquí no se probaron tasa de fotogramas completa ni hardware mínimo.
- Cuándo evitar
- Elige otro flujo cuando necesites movimiento 3D medido o una imagen generada terminada. Las coordenadas estimadas y la guía de pose de DWPose no establecen ninguno de esos resultados.
Fuentes y método
Licencia y derechos
- Licencia
- Apache 2.0 para el código oficial DWPose y los checkpoints ONNX
- Tipo de licencia
- Código abierto
- Alcance de la licencia
- Apache 2.0 se declara para el código oficial DWPose revisado y la pareja yolox_l.onnx / dw-ll_ucoco_384.onnx en la revisión fija del repositorio oficial. Conserva los avisos exigidos y revisa aparte derivados, modelos posteriores, servicios, entradas y salidas.
- Código abierto
- Sí
Disponibilidad
- Estado
- Disponible
- Alcance del estado
- El proyecto oficial publica código y la pareja ONNX indicada. Disponible se refiere a esos materiales, sin garantizar un servicio alojado, compatibilidad de hardware, seguimiento de vídeo o calidad de generación.
Aspectos clave
Detección y estimación de pose son etapas distintas
La vía ONNX revisada detecta personas antes de estimar la pose. Diagnostica la persona seleccionada y su región delimitadora antes de atribuir el fallo a la calidad de los puntos clave.
Los puntos clave brutos no son el mapa dibujado
La integración revisada filtra y remapea puntos antes de dibujar cuerpo, manos y cara. Omite los puntos de los pies calculados aparte; una estimación del cuerpo entero no implica que todos aparezcan en la guía.
El paquete de preprocesamiento revisado usa Apache 2.0
El código oficial y los archivos ONNX exactos del detector y de pose del repositorio oficial revisado declaran Apache 2.0. Generadores posteriores, integraciones, entradas y salidas requieren una revisión separada.
Casos de uso y límites
Preparación de mapas de pose para un flujo controlado
Usa una referencia, identifica a la persona deseada y las relaciones entre articulaciones visibles y revisa detección, puntos brutos, mapa dibujado e imagen posterior como cuatro etapas separadas.
Aislar el fallo antes de corregir a mano
Un artista técnico puede comparar la primera representación que falla con la referencia y decidir si debe ajustar detección, mapeo, guía dibujada o generador posterior.
Ventajas
- La implementación revisada permite identificar por separado las etapas del detector y del estimador de pose.
- El estimador devuelve coordenadas y puntuaciones de confianza antes de que la capa de dibujo cree la imagen guía.
- El código oficial revisado y el repositorio de los checkpoints ONNX exactos declaran Apache 2.0.
Limitaciones
- Un mapa de pose correcto no garantiza que un generador de imágenes posterior lo respete.
- La supresión por baja confianza, el remapeo y las decisiones de dibujo pueden hacer que el mapa visible difiera de la salida bruta del cuerpo entero.
- La integración revisada contiene comportamiento específico de CUDA y no demuestra compatibilidad o velocidad para todas las integraciones.
Temas
- DWPose
Acerca del modelo
En esta página
DWPose estima puntos clave del cuerpo, las manos, la cara y los pies de personas en una imagen. En un flujo de generación de imágenes, su función es aportar información de pose a otro sistema; no convierte por sí mismo un prompt en un personaje terminado. Evalúalo cuando necesites una referencia de pose que puedas inspeccionar y depurar, especialmente si una imagen generada plausible podría ocultar una mano incorrecta, una persona ausente o una articulación invertida.
Esta guía revisa las fuentes del proyecto de investigación y de su integración ONNX oficial, comprobadas el 10 de septiembre de 2026. No ejecutamos inferencia de pose, mediciones de tiempo ni comparaciones de imágenes generadas para este artículo. El ejemplo es una propuesta de evaluación, no un informe de una prueba satisfactoria.
Revisiones de las fuentes consultadas: código 3dca5db7, ficha del modelo 1a714410.
Identifica qué parte del flujo corresponde a DWPose
El artículo de DWPose describe la estimación de pose del cuerpo entero y un método de destilación en dos etapas utilizado para entrenar los estimadores. Esas etapas de entrenamiento no son dos pasos de inferencia que el usuario deba ejecutar en cada fotografía. El proyecto publica modelos de varios tamaños; el nombre por sí solo no identifica una cantidad universal de parámetros ni una velocidad única. Artículo de investigación de DWPose.
Para diagnosticar problemas, separa cuatro elementos: imagen de entrada, personas detectadas y puntos clave, representación de pose enviada al siguiente sistema e imagen final generada. Guarda cada uno durante la evaluación. Si el mapa de pose es incorrecto, cambiar el prompt difícilmente explicará el error original. Si el mapa es correcto pero la imagen generada lo ignora, la siguiente investigación corresponde a las etapas posteriores.
Esta distinción resulta útil para referencias de personajes. Imagina que un ilustrador necesita una figura sujetando una caja pequeña delante del torso. Las manos se superponen al objeto, un codo está parcialmente oculto y aparece otra persona en el borde de la foto. Un vestuario o una cara convincentes no demuestran que se haya transferido la pose. Decide qué persona y qué articulaciones importan antes de juzgar el atractivo general de la imagen.
DWPose no sustituye un rig tridimensional medido, un sistema de captura de movimiento ni una evaluación de seguridad específica de la tarea. No deduzcas esas capacidades de una visualización del esqueleto. Un preprocesador de pose puede ser útil sin admitir todas las aplicaciones que usan la palabra «pose».
Separa las coordenadas brutas del mapa dibujado
En el ejemplo ONNX oficial, el módulo de cuerpo entero llama primero a un detector de personas y después a un estimador de pose. También calcula una posición del cuello y reasigna índices para su representación de estilo OpenPose. Un consumidor que espere el orden original de la investigación debe comprobar la interfaz real, sin suponer que todos los arrays exportados tienen el mismo significado. Módulo de cuerpo entero.
La capa de dibujo normaliza coordenadas y suprime puntos de baja confianza antes de representar cuerpo, manos y cara. Su salida final es una imagen ráster de pose, no el array original completo de puntos clave. El código calcula un segmento para los pies, pero no lo incluye en el diccionario de pose enviado a la función de dibujo. Es una razón concreta para no prometer que la vista previa de ControlNet muestre todos los puntos brutos del cuerpo entero. Implementación del mapa de pose.
Antes de conectar tu propio consumidor, anota qué espera: imagen o coordenadas, píxeles o unidades normalizadas, orden de personas y articulaciones y tratamiento de valores ausentes. Contrasta un punto reconocible con la imagen original. Una muñeca izquierda puede aparecer en el lado correcto de la vista previa y estar mal etiquetada en una exportación numérica personalizada.
Si necesitas coordenadas estructuradas, utiliza una interfaz que realmente las exponga y conserva la confianza o la información de puntos ausentes. No intentes recuperar coordenadas precisas leyendo los colores de una captura comprimida. Añadirías otra conversión con pérdidas y dificultarías el diagnóstico.
Elige una vía de instalación y registra sus dependencias
El repositorio distingue el entorno de investigación con MMPose de la integración con ControlNet. Su rama ONNX permite utilizar esa integración sin instalar MMPose completo y remite a otra rama basada en OpenCV. Son vías distintas, no una lista de paquetes que todos deban instalar juntos. Instrucciones de instalación.
En el ejemplo ONNX documentado importan tanto el checkpoint de detección de personas como el de pose. Guardar solo el nombre del archivo del modelo de pose deja parte del flujo sin especificar. Conserva juntos el commit y la rama del repositorio, los identificadores de ambos checkpoints, el proveedor de ejecución, el preprocesamiento y la versión del modelo posterior. Ejemplo ONNX oficial.
Lee la selección del dispositivo en el código que realmente ejecutas. El módulo revisado selecciona CUDA en el constructor; la presencia de una rama CPU en una expresión no demuestra que una copia sin modificar elija automáticamente la CPU en tu equipo. Un nodo comunitario puede comportarse de otra manera. Es otra razón para identificar la integración concreta en lugar de tratar todas las integraciones DWPose como intercambiables.
Usa un entorno aislado para la prueba y conserva el registro de dependencias. Las versiones antiguas fijadas en tutoriales pueden ayudar a reproducir una configuración anterior, pero no demuestran compatibilidad con tus controladores gráficos o aplicación actuales. Aquí no instalamos esos entornos, por lo que esta guía no certifica una combinación concreta de sistema operativo y GPU.
Revisa los derechos de todo el flujo
El código del repositorio DWPose tiene licencia Apache 2.0. El README oficial también dirige a los usuarios al repositorio Hugging Face yzd-v/DWPose para sus modelos. En la revisión inmutable examinada aquí, ese repositorio declara Apache 2.0 y contiene la pareja ONNX exacta del ejemplo oficial: yolox_l.onnx para detectar personas y dw-ll_ucoco_384.onnx para estimar la pose. Licencia del repositorio. Licencia de la ficha en revisión fija.
Esa evidencia se refiere al código oficial revisado y a esos dos archivos de checkpoint. No autoriza de forma general una réplica renombrada, un checkpoint derivado, un modelo ControlNet o Stable Diffusion, una capa de integración, un servicio alojado, una fotografía original o un resultado generado. Conserva los avisos obligatorios al redistribuir el material cubierto, coteja las descargas con la fuente revisada y examina los términos propios de cada componente restante.
Para la referencia de personaje, registra quién proporcionó la fotografía y si se permiten la transformación y la publicación previstas. Una representación de pose no elimina obligaciones asociadas a la fuente. No presentes personas generadas como clientes, empleados o prescriptores reales, ni supongas que usar solo información del esqueleto resuelve automáticamente cuestiones de privacidad o derecho a la propia imagen.
Si una implantación comercial sustituye el checkpoint o depende de otro componente con condiciones inciertas, detén esa decisión hasta resolverlas. La declaración Apache 2.0 de la pareja oficial revisada no se transfiere a otro archivo por tener un nombre parecido o aparecer junto a un botón de descarga. Este artículo no es asesoramiento jurídico ni concede permiso para un flujo ensamblado con distintos componentes.
Diseña una prueba de pose cuyos fallos sean útiles
Usa la referencia sujetando la caja como caso deliberadamente limitado. Marca la persona deseada y las relaciones esenciales: qué mano sostiene la caja, si los codos cruzan el torso y hacia dónde se orientan los hombros. Conserva una segunda imagen con una pose sencilla como control. Son entradas hipotéticas de evaluación, no imágenes que hayamos procesado.
Registra las dimensiones de la referencia y todos los recortes y cambios de tamaño. Conserva la entrada completa junto con cualquier recorte de la persona, porque un encuadre más cerrado cambia la evidencia disponible para el detector. Si el flujo final contiene varias personas, incluye esa situación en la muestra; una figura aislada no valida la selección ni el orden de personas.
Primero examina la detección y el mapa de pose sin generar una imagen. Compara las articulaciones visibles con la referencia y marca como inciertas las zonas ambiguas u ocultas. No puntúes una suposición plausible como una posición anatómica verificada cuando la fuente no la muestra. Guarda el mapa que realmente recibirá el modelo siguiente, no otra vista de depuración.
Prueba el generador posterior solo cuando esta etapa sea aceptable. Mantén fijos prompt, seed, modelo, ajustes de condicionamiento y dimensiones de salida mientras cambias una entrada pertinente. De lo contrario, una imagen más atractiva podría deberse a otro seed o checkpoint, y no a una mejor estimación de pose.
Aplica una hoja de aceptación de cuatro etapas
Esta hoja es una propuesta original para el trabajo del ilustrador. Separa intencionadamente la corrección de la pose del estilo visual. Complétala con tus observaciones y conserva los ejemplos rechazados.
| Etapa | Pregunta que responder | Evidencia para aceptar |
|---|---|---|
| Selección de persona | ¿Se representa a la persona deseada sin incorporar la figura del borde a su pose? | Imagen original marcada y salida correspondiente de detección o pose. |
| Posición de articulaciones | ¿Hombros, codos y muñecas visibles coinciden con el gesto requerido? | Comparación junto a la referencia, con articulaciones inciertas u ocultas señaladas en vez de adivinadas. |
| Entrega de la representación | ¿El consumidor posterior recibe el mapa o formato de coordenadas esperado? | Archivo guardado, dimensiones, convención de índices y coordenadas e importación comprobada. |
| Resultado generado | ¿El personaje final mantiene el gesto con la configuración de generación fija? | Comparación con las relaciones predefinidas entre manos, codos y torso. |
Una etapa puede superar la prueba y la siguiente fallar. Conserva esa distinción en lugar de resumirlo todo en una nota de calidad. Una muñeca detectada correctamente seguida de una mano mal dibujada es un fallo distinto de una muñeca ausente antes de generar. Las correcciones y las pruebas necesarias para verificarlas también cambian.
Fija un presupuesto de edición antes de la prueba. Si una persona corrige unas pocas articulaciones rápidamente, un flujo semimanual puede cumplir el encargo. Si cada referencia necesita una reconstrucción extensa, el mismo sistema podría no servir para esa carga de trabajo. Registra tiempo de corrección y entradas rechazadas, no solo generaciones satisfactorias.
Investiga los errores en su primera etapa visible
Las siguientes son hipótesis de diagnóstico, no tasas de fallo medidas para DWPose. Usa los materiales intermedios guardados para decidir qué explicación corresponde a tu caso.
| Síntoma | Primera comprobación | Siguiente acción controlada |
|---|---|---|
| Falta la persona deseada | Si el detector la encontró en la entrada realmente procesada. | Comparar el encuadre completo y un recorte deliberado, conservando ambos resultados. |
| Falta una mano en el mapa | Visibilidad, escala y supresión por confianza antes del dibujo. | Examinar el recorte original y los valores brutos disponibles; no cambiar de inmediato el generador. |
| Izquierda y derecha parecen intercambiadas | Mapeo de índices y convenciones de coordenadas al exportar e importar. | Seguir una articulación inequívoca durante la conversión y compararla con la fuente. |
| El mapa parece correcto, pero cambia el gesto generado | Entrada de condicionamiento, formato admitido y ajustes posteriores. | Repetir con la misma configuración del generador y un mapa de pose conocido como aceptable. |
| Las poses del vídeo parpadean entre fotogramas | Detecciones por fotograma, oclusión y asociación de personas. | Revisar mapas adyacentes antes de afirmar que los ajustes de generación de imágenes solucionan el problema. |
En vídeo, no equipares la inferencia repetida de imágenes fijas con un seguimiento validado. Determina si tu aplicación requiere identidad estable, trayectorias suaves o solo mapas independientes. Esos requisitos necesitan pruebas explícitas de más de un fotograma; aquí no se realizó ninguna prueba de secuencia.
Compara el coste total de corrección, no una cifra de fotogramas
Mide cada etapa por separado: preparación de imagen, detección de personas, estimación de pose, dibujo o exportación y generación posterior. Registra la inicialización aparte de la inferencia en caliente. Anota el hardware y el proveedor de ejecución realmente usados. Una tasa de fotogramas sin esos límites no permite saber a un artista técnico cuánto tardará una referencia utilizable.
Las regiones de entrada más grandes, otras variantes de modelo y un detector distinto pueden cambiar la carga. En lugar de asumir que el modelo mayor siempre es el adecuado, compara candidatos con las mismas articulaciones esenciales y presupuesto de corrección. El benchmark del artículo mide una tarea de investigación definida; no certifica la latencia de tu integración ni la calidad de las manos del personaje generado.
Si crear la pose con precisión importa más que extraerla automáticamente, una pose editada a mano o un rig controlado puede ser un inicio más directo. Si la identidad a lo largo del tiempo es central, evalúa un flujo que trate explícitamente el seguimiento. Si la fuente es demasiado ambigua para establecer el gesto, conseguir una referencia más clara puede ser más útil que cambiar parámetros repetidamente.
La siguiente decisión es concreta: ¿tu implementación DWPose proporciona la representación requerida con un trabajo de corrección aceptable? Responde antes de declarar que todo el flujo de imágenes funciona. El directorio de modelos permite explorar otras categorías, pero aquí no se ofrece un ranking entre modelos ni una promesa de sustitución universal.
Preguntas frecuentes
¿Qué parte del flujo de imágenes realiza DWPose?
En la vía revisada, DWPose detecta personas, estima puntos clave de pose y puede dibujar un mapa. No realiza por sí mismo la generación posterior de imágenes.
¿El mapa DWPose dibujado incluye todos los puntos brutos?
No lo des por hecho. La vía de dibujo revisada suprime puntos de baja confianza y entrega datos de cuerpo, manos y cara; el segmento calculado de los pies no entra en ese diccionario de dibujo.
¿DWPose es de código abierto?
El código oficial revisado y los materiales ONNX exactos de detección y pose declaran Apache 2.0. Esa clasificación no cubre modelos posteriores, capas de integración, entradas del usuario ni salidas generadas.
¿Se probó aquí la precisión o velocidad de DWPose?
No. Es una evaluación basada en fuentes. No establece tasa de fotogramas, requisitos de hardware, precisión de pose ni calidad de imagen posterior para tu flujo.