¿Has usado esta herramienta? Valórala
¿Has usado esta herramienta? Valórala
Modal es una nube serverless que ejecuta código Python en GPU y CPU con facturación por segundo; la empresa la describe como infraestructura en la nube para equipos que desarrollan, entrenan y sirven aplicaciones de IA a escala.
Modal mete tu código en un contenedor, lo ejecuta en la nube y añade contenedores automáticamente cuando crece el tráfico, agrupando capacidad de las principales nubes para elegir dónde corre cada tarea. Las imágenes de contenedor y las solicitudes de GPU se escriben en Python, así que una aplicación de Modal no tiene archivos de despliegue YAML.
Modal Labs opera modal.com. Según la prensa tecnológica independiente, Modal fue fundada en 2021 por Erik Bernhardsson, CEO, y Akshat Bubna, CTO; la empresa afirma haber recaudado más de 466 millones de dólares de inversores como General Catalyst y Redpoint Ventures. El 28 de septiembre de 2026, una noticia tecnológica que citaba una fuente anónima dijo que Modal Labs, a la que describía como proveedor de infraestructura de inferencia de IA, estaba cerca de cerrar una ronda de 750 millones de dólares liderada por Accel con una valoración de 15.750 millones de dólares; Modal Labs no quiso comentar.
Modal cubre la inferencia con lo que llama arranques en frío de menos de un segundo, trabajos por lotes en paralelo, entrenamiento y ajuste fino, Sandboxes aisladas para código generado por IA y Notebooks colaborativos con GPU.
El argumento gpu acepta T4, L4, A10, L40S, A100 (genérica, 40 GB u 80 GB), RTX PRO 6000, H100 (o H100!), H200, B200 (o B200+) y B300. B300, B200, H200, H100, A100, L4, T4 y L40S admiten hasta 8 GPU por contenedor (hasta 2.304 GB de RAM de GPU); la A10 se queda en 4 GPU y 96 GB.
Dos mejoras automáticas importan para los benchmarks: una solicitud de H100 puede correr en una H200 y una de A100 en una A100 de 80 GB, al precio original, mientras que solicitar H100! excluye la mejora a H200. Una función también puede listar tipos de GPU en orden de preferencia, y Modal va bajando por la lista.
Modal Sandboxes son contenedores seguros, definidos en tiempo de ejecución, para ejecutar código no fiable de usuarios o agentes. Modal afirma que se pueden crear millones por programación en menos de un minuto, con instantáneas y restauración para arrancar rápido.
Notebooks de Jupyter alojados con precios serverless, apagado automático por inactividad, GPU de Modal y edición colaborativa en tiempo real.
Modal anunció el 1 de octubre de 2026 que Modal Clusters tiene disponibilidad general con el decorador @modal.clustered: grupos de GPU multinodo con RDMA, planificados en bloque desde un pool de capacidad compartido y facturados por segundo.
pip install modal y después modal setup para autenticarte (o python -m modal setup si la primera forma falla).@app.function(...), indicando la imagen de contenedor y la GPU, y ejecuta el archivo con modal run path/to/file.py.Modal dice que los contenedores arrancan en un segundo aproximadamente, pero solo están calientes tras ejecutarse las importaciones y demás configuración de ámbito global, así que estar listos puede llevar de segundos a minutos. Tres ajustes equilibran latencia y gasto en reposo:
scaledown_window: mantiene vivos los contenedores inactivos de 2 segundos a 20 minutos; ventanas más largas dan menos arranques en frío, pero los recursos inactivos se facturan.min_containers y buffer_containers: el primero mantiene un mínimo de contenedores calientes para que la función nunca escale a cero; el segundo añade contenedores de reserva mientras está activa.us ofrece un pool de recursos mayor que una estrecha y mejora así el tiempo de arranque en frío y la disponibilidad.Modal puede desplegar cualquier aplicación Python contenerizable y se orienta al cómputo intensivo con escalado horizontal: inferencia de ML a escala, entrenamiento y ajuste fino de modelos, pipelines de datos, cómputo científico y colas de trabajos.
Las tres citas de clientes son testimonios de la página de inicio, no estudios de caso independientes.
Las señales de reseñas independientes de esta ronda son limitadas: en una plataforma de reseñas de una comunidad de lanzamientos, Modal tenía un 5,0 con 61 reseñas a 5 de octubre de 2026, y su resumen de IA dice que los autores son sobre todo fundadores y que casi no hay críticas.
routing_region también acepta us-west (Oregón), eu-west (Dublín) y ap-south (Bombay).Modal combina un plan mensual con precios de GPU por segundo y CPU y memoria medidas por uso; los precios de lista siguientes se capturaron el 5 de octubre de 2026.
| Plan | Tarifa de plataforma | Cómputo incluido | Puestos | Contenedores / concurrencia de GPU | Retención de registros | Tráfico de salida incluido |
|---|---|---|---|---|---|---|
| Starter | $0 + cómputo / mes | $30 / mes | 3 | 100 / 10 | 1 día | 1 TiB / mes |
| Team | $250 + cómputo / mes | $100 / mes | Ilimitados | 5.000 / 50 | 30 días | 10 TiB / mes |
| Enterprise | Personalizado | Personalizado | Ilimitados | Mayor concurrencia de GPU | Personalizada | 100 TiB / mes |
Enterprise añade descuentos por volumen, servicios integrados de ingeniería de ML, soporte privado por Slack, registros de auditoría, SSO con Okta y HIPAA. Starter permite 200 aplicaciones desplegadas y 5 tareas cron desplegadas, y excluye dominios personalizados, reversiones de despliegue, presupuestos por entorno, el proxy de IP estática y RBAC; Team conserva 3 versiones para reversión.
| Recurso | Precio por segundo |
|---|---|
| Nvidia B300 | $0.001972 |
| Nvidia B200 | $0.001736 |
| Nvidia H200 SXM | $0.001261 |
| Nvidia H100 SXM5 | $0.001097 |
| Nvidia RTX PRO 6000 | $0.000842 |
| Nvidia A100, 80 GB | $0.000694 |
| Nvidia A100, 40 GB | $0.000583 |
| Nvidia L40S | $0.000542 |
| Nvidia A10 | $0.000306 |
| Nvidia L4 | $0.000222 |
| Nvidia T4 | $0.000164 |
| CPU, por núcleo físico (2 vCPU) | $0.0000131 |
| Memoria, por GiB | $0.00000222 |
La CPU tiene un mínimo de 0,125 núcleos por contenedor. Sandboxes y Notebooks usan tarifas de CPU y memoria más altas, $0.00003942 por núcleo y $0.00000667 por GiB por segundo, con las GPU a precio estándar. Los Volumes cuestan $0.09 por GiB al mes tras 1 TiB gratis, y el tráfico de salida que excede la asignación del plan, $0.04 por GiB. El ejemplo de cálculo de Modal sitúa Stable Diffusion en una A10G en unos $0.491 por 1.000 imágenes.
nonpreemptible=True triplica los precios de lista de CPU y memoria y no está disponible para funciones con GPU.Cada plataforma de GPU sin servidor de la lista difiere de Modal sobre todo en cómo factura la inactividad y en la amplitud de su oferta de GPU.
| Opción | Oferta de GPU | Escalado a cero | Regla de inactividad y facturación |
|---|---|---|---|
| Google Cloud Run (GPU) | RTX PRO 6000 Blackwell (96 GB) o L4 (24 GB) | Sí | Facturación por instancia; las instancias mínimas se cobran a tarifa completa aun inactivas |
| RunPod Serverless | No tratado aquí | Workers flexibles sí; los workers activos funcionan 24/7 | Facturado por segundo desde el arranque del worker hasta su parada total, redondeado al alza |
| Replicate | No tratado aquí | Modelos públicos sí | La mayoría de modelos privados corren en hardware dedicado y se facturan por tiempo de configuración, inactividad y actividad |
La división entre workers flexibles y activos de RunPod equivale a elegir min_containers en Modal. Replicate factura la mayoría de modelos públicos por tiempo de ejecución y algunos por entrada y salida. Modal se diferencia por la infraestructura definida en Python y las Sandboxes en la misma cuenta, además de una lista de GPU más larga que la de Cloud Run.
routing_region solo puede establecerse en el primer despliegue de una función, y las entradas y salidas de más de 2 MiB siguen pasando por el almacenamiento de objetos en us-east.El acuerdo de Modal prohíbe la minería de criptomonedas o actividades blockchain relacionadas, los ataques de denegación de servicio, el intercambio de archivos entre pares y las plataformas generales de alojamiento de archivos o de distribución de medios.
Starter no tiene tarifa de plataforma e incluye $30 de cómputo al mes, pero la guía de facturación exige un método de pago registrado y los tokens de los endpoints compartidos se facturan desde la primera solicitud.
No después de escalar a cero. El keep-alive predeterminado de 60 segundos y el tiempo de inactividad dentro de un scaledown_window más largo se facturan, y min_containers impide que la función llegue nunca a cero.
Las funciones y las Sandboxes pueden fijarse a regiones de la UE con un multiplicador de 1,15 o 1,75, con enrutamiento por eu-west, pero los registros de aplicación permanecen en EE. UU., las entradas y salidas grandes pasan por us-east y los endpoints compartidos no pueden fijarse.