fei-fei-li-atlas-ia-mundos-3d
fei-fei-li-atlas-ia-mundos-3d

Fei-Fei Li presenta Atlas, una IA que genera, reconstruye y simula mundos 3D

World Labs, la empresa de inteligencia artificial cofundada por Fei-Fei Li, presentó ayer martes 1 de septiembre de 2026 Atlas, una IA que genera imágenes, vídeo y mundos 3D navegables con comprensión del espacio y del tiempo. Para lograrlo, Atlas opera de forma nativa sobre texto, imágenes, vídeo y datos 3D en una única arquitectura, y permite desde controlar la cámara con precisión de píxel hasta reconstruir escenas reales y simular robots, todo desde unas pocas imágenes de entrada. Fei-Fei Li es profesora de Stanford y conocida por crear ImageNet, uno de los proyectos clave en el desarrollo del aprendizaje profundo moderno.

El anuncio de Atlas llega después de un año de expansión y fuertes inversiones. En febrero de 2026, World Labs recaudó 1.000 millones de dólares en una ronda de financiación respaldada por inversores como NVIDIA, AMD, Autodesk y Fidelity, entre otros, para acelerar el desarrollo de su tecnología de inteligencia espacial. El pasado noviembre de 2025, World Labs lanzó Marble, su primer producto comercial, capaz de generar entornos 3D explorables a partir de texto, imágenes o vídeo; en enero de 2026 presentó la World API y, el 21 de julio de 2026, adquirió la compañía de robótica SceniX. Atlas es el siguiente escalón y, de hecho, la empresa lo describe como el modelo de base que impulsará las futuras versiones de Marble.

Google elimina uBlock Origin de Chrome: así puedes seguir navegando sin publicidad

¿Qué es Atlas y cómo funciona?

World Labs define Atlas como un modelo de mundo omni, es decir, un sistema que genera, reconstruye y simula mundos de forma general. La tesis de la compañía es la «inteligencia espacial», que básicamente indica, que la IA necesita razonar sobre objetos, lugares y consecuencias en el espacio tridimensional, no solo procesar texto. Atlas es la materialización de esa idea en un modelo único, en lugar de dividir las tareas entre sistemas de vídeo, reconstrucción y simulación separados, como se hace actualmente.

Técnicamente, Atlas es un transformer autoregresivo de difusión multimodal, preentrenado desde cero. Esto significa que combina tres paradigmas. Es multimodal, porque procesa de forma nativa texto, imágenes, poses de cámara y mapas de profundidad 3D. Es autoregresivo, porque genera cada nuevo elemento de una secuencia condicionado a los anteriores, igual que un modelo de lenguaje. Y, es de difusión (un modelo de flujo rectificado), porque genera las salidas eliminando el ruido de forma gradual, lo que le permite intercambiar velocidad y calidad según los pasos de denoising utilizados (como pasa con el conocido StableDiffusion).

La clave distintiva de Atlas es su «contexto espacial». Igual que un modelo de lenguaje codifica su entrada en un contexto, Atlas ancla cada imagen a una posición concreta en el espacio 3D. Ese contexto espacial compartid es lo que le permite al modelo, mantenerse coherente en tres dimensiones, con todo lo que ha visto e imaginar lo que hay más allá. Por ejemplo, el usuario puede colocar dos imágenes de referencia no relacionadas, posicionarlas en el espacio y Atlas genera un mundo que interpola suavemente entre ambas, imaginando puertas, pasillos y transiciones.

Las cuatro capacidades principales

Atlas cubre cuatro grandes áreas de funcionalidad. La primera es la generación controlada por cámara. Partiendo de una o varias imágenes de referencia, genera vídeo de hasta un minuto a resolución 1440p (2k) con un control de cámara de precisión de píxel. A diferencia de otros modelos, que reciben las instrucciones de cámara como texto, Atlas las codifica como geometría de cámara nativa, lo que permite encuadrar cada plano y controlar cada movimiento de forma certera. La empresa compara la experiencia con ser el director de una escena en lugar de tirar de una máquina tragaperras y esperar a que la escena sea lo esperado.

La segunda es la reconstrucción espacial. Atlas reconstruye escenas del mundo real a partir de una o decenas de imágenes, sin necesidad de equipos de captura especializados. Genera tanto fotogramas desde puntos de vista nuevos como salidas 3D explícitas, como nubes de puntos y splats gaussianos 3D. La empresa asegura que, con tan solo dos o tres imágenes, Atlas produce reconstrucciones fieles que superan a los modelos especializados únicamente en reconstrucción 3D, y que puede usar más de cien imágenes de entrada para recrear entornos reales completos, como el patio central de la Universidad de Stanford que muestra en sus demostraciones.

Control espacio-temporal

La tercera es la simulación espacio-temporal. Atlas entiende tanto la estructura espacial del mundo como su evolución en el tiempo. Con grabaciones de tan solo tres a cinco cámaras, puede congelar el tiempo y reencuadrar planos desde ángulos imposibles, convirtiendo unos pocos teléfonos móviles en un estudio de captura «bullet time». Para robótica, Atlas reconstruye un entorno desde un vídeo grabado con un teléfono y genera los datos RGB y de profundidad que observarían los sensores de un robot mientras navega o manipula objetos, un flujo que la empresa llama «Real-to-Sim».

La cuarta es la generación de imágenes: aunque no es su foco principal, Atlas sigue prompts complejos, renderiza texto y produce una amplia variedad de estilos visuales, además de panoramas de 360 grados.

Javier Callejo advierte sobre la IA: la elegancia verbal del algoritmo debilita el juicio crítico

Una competencia en aprietos

World Labs publica comparativas en dos tareas clave. En generación controlada por cámara, evaluadores humanos externos prefirieron Atlas frente a modelos de vídeo recientes, con una ventaja que crece cuanto más compleja es la trayectoria de cámara: un 75% de preferencia frente a MiniMax H3, un 81% frente a Gemini Omni Flash, un 86% frente a Happy Horse 1.1, un 93% frente a FLUX 3 y un 94% frente a Seedance 2.5. En reconstrucción 3D desde vistas dispersas, Atlas supera a cinco modelos de referencia especializados, incluidos Pi3X, π³, VGGT-Ω, Depth Anything 3 y MapAnything, según el error de mapas de puntos en benchmarks como DTU, ETH3D, KITTI, ScanNet y 7-Scenes.

Un ejemplo de como los usuarios prefieren usar Atlas a otros modelos para escenas camera-controlled.
Un ejemplo de como los usuarios prefieren usar Atlas a otros modelos para escenas camera-controlled

Conviene matizar que estas cifras provienen de la propia World Labs, que es quien reproduce los resultados de los competidores, y la empresa reconoce que no existe un único benchmark que capture la generalidad de un modelo omni. Después de todo, el campo de los modelos de mundo es competitivo. NVIDIA trabaja en su pila de simulación Omniverse y sus modelos Cosmos, Google DeepMind ha mostrado su renderizador interactivo Genie 3, y startups como Odyssey o Decart desarrollan simulaciones interactivas, mientras que Niantic Spatial se centra en el mapeo geoespacial y el laboratorio de Yann LeCun, AMI Labs, en modelos de control para el mundo físico. La apuesta de World Labs es que un solo modelo capaz de aceptar entradas multimodales ancladas espacialmente y producir vídeo, geometría 3D y vistas de sensores simuladas pueda sostener una categoría propia.

Un nuevo futuro por explorar

Atlas entra en acceso temprano con socios seleccionados; la compañía no ha revelado el número ni la identidad de esos socios, ni los precios ni una fecha de disponibilidad general. Eso significa que, por ahora, la validación independiente del modelo está pendiente de las cargas de trabajo de sus partners. La prueba de fuego, como señala la prensa especializada, será si Atlas mantiene la geometría cuando las imágenes de referencia se contradicen, si separa la reconstrucción fiel de la invención plausible y si sus simulaciones siguen siendo útiles cuando un robot empieza a interactuar con la escena.

Para World Labs, Atlas representa la consolidación de su tesis; una inteligencia que entienda el espacio es el siguiente paso tras los modelos de lenguaje. La empresa sostiene que el rendimiento del modelo mejora con más cómputo de entrenamiento y espera que esa tendencia se mantenga al escalar. Si la promesa se cumple, Atlas podría convertirse en la infraestructura de una nueva generación de herramientas creativas y de robótica, y en el argumento de que la inteligencia espacial es, además de una dirección científica prometedora, un negocio viable.

El negocio circular de las empresas de IA: crear el riesgo y cobrar por contenerlo

Comparte esto: