Biología generativa: cuando la IA empieza a diseñar vida

Biología generativa e inteligencia artificial: del código genético al diseño de proteínas y sistemas celulares

Durante buena parte de la historia de la biología moderna, el desafío fue aprender a leer. Primero secuenciamos genes; después comenzamos a relacionar esas secuencias con proteínas, estructuras y funciones. En los últimos años, herramientas como AlphaFold mostraron hasta qué punto la inteligencia artificial podía ayudarnos a comprender la arquitectura molecular de la vida. CRISPR dio un paso diferente: permitió modificar de manera dirigida parte de ese código.

Pero una nueva generación de modelos plantea una pregunta todavía más profunda. ¿Qué ocurre cuando una inteligencia artificial deja de limitarse a interpretar o modificar la biología existente y comienza a proponer moléculas, proteínas y secuencias que nunca existieron en la naturaleza?

Ese es el territorio de la biología generativa. El término reúne tecnologías diferentes, pero todas comparten una idea con la IA generativa que produce textos o imágenes: aprender regularidades a partir de enormes cantidades de datos y utilizarlas para generar algo nuevo. La diferencia es que aquí el resultado no es una frase ni una fotografía. Puede ser la secuencia de una proteína, un fragmento de ADN o, al menos en principio, una parte cada vez mayor de un sistema biológico.

La comparación debe utilizarse con cautela. Una imagen generada puede evaluarse inmediatamente en una pantalla. Una secuencia biológica puede parecer perfectamente plausible para un modelo y, sin embargo, no plegarse correctamente, no funcionar dentro de una célula, resultar tóxica o producir efectos inesperados. La biología está sometida a restricciones físicas, químicas y evolutivas que no desaparecen porque un algoritmo sea capaz de generar una secuencia convincente. Entre diseñar algo en una computadora y demostrar que funciona en un sistema vivo continúa existiendo una distancia experimental considerable.

De predecir proteínas a diseñarlas

El cambio puede entenderse observando lo ocurrido con las proteínas. AlphaFold convirtió la predicción de estructuras en una herramienta extraordinariamente poderosa, pero su pregunta fundamental era: dada una secuencia, ¿qué estructura probablemente adopte esta proteína? Los modelos generativos permiten invertir parcialmente el problema. Podemos comenzar con una estructura, una superficie de unión o determinada función y pedir al sistema que explore qué proteínas podrían cumplirla.

RFdiffusion fue uno de los hitos de esta transición. Publicado en Nature en 2023, adaptó el concepto de los modelos de difusión —popularizados por la generación de imágenes— al diseño de estructuras proteicas. El sistema produjo proteínas de novo, ensamblajes y moléculas diseñadas para unirse a blancos determinados, y numerosos diseños fueron sintetizados y evaluados experimentalmente. No se trataba simplemente de recuperar proteínas existentes de una base de datos, sino de explorar regiones del espacio molecular que la evolución conocida no había recorrido de esa manera.

Desde entonces, el campo avanzó rápidamente. Una revisión publicada en Nature en 2026 sostiene que algunos problemas clásicos del diseño de nuevas estructuras, ensamblajes y proteínas de unión están cerca de dejar de ser principalmente problemas de “cómo diseñar” para convertirse en problemas de “qué conviene diseñar”. La afirmación no significa que cualquier proteína imaginable pueda obtenerse a voluntad. Diseñar enzimas complejas, interruptores moleculares, sistemas con múltiples estados o verdaderas nanomáquinas continúa siendo considerablemente más difícil. Pero la frontera se desplazó.

Una proteína que la evolución nunca produjo

ESM3 ofrece otro ejemplo particularmente ilustrativo. Este modelo fue desarrollado para trabajar simultáneamente con secuencia, estructura y función de proteínas. En un trabajo publicado en Science en 2025, los investigadores le pidieron generar proteínas fluorescentes y sintetizaron algunas de sus propuestas. Entre ellas encontraron una proteína fluorescente funcional cuya secuencia presentaba apenas un 58 % de identidad con la proteína fluorescente conocida más cercana.

Los autores estimaron que esa distancia sería comparable a aproximadamente 500 millones de años de divergencia evolutiva. Es importante entender qué significa esa comparación: la computadora no reprodujo literalmente 500 millones de años de evolución. Se trata de una estimación basada en la distancia entre secuencias. Lo relevante es más concreto y, quizá, más interesante: un modelo entrenado con diversidad biológica fue capaz de proponer una proteína funcional muy distante de las secuencias naturales conocidas y, al sintetizarla, el laboratorio confirmó que efectivamente era fluorescente.

El mismo principio comienza a extenderse a las herramientas con las que intervenimos la biología. Como vimos al analizar CRISPR e inteligencia artificial, OpenCRISPR-1 mostró que un modelo generativo podía proponer un editor CRISPR-Cas funcional y muy alejado en secuencia de las Cas9 naturales de referencia. En células humanas mostró actividad de edición y compatibilidad con edición de bases. Aquí interesa menos repetir aquel experimento que advertir el cambio de escala: la inteligencia artificial ya no sólo selecciona entre herramientas biológicas existentes, sino que comienza a explorar versiones nuevas de esas herramientas.

¿Puede una IA escribir ADN?

El siguiente nivel es considerablemente más complejo. Las proteínas suelen contener cientos de aminoácidos; los genomas pueden contener desde cientos de miles hasta miles de millones de bases y su funcionamiento depende de relaciones que abarcan enormes distancias dentro de la secuencia. Modelar un genoma exige aprender regularidades relacionadas no sólo con genes individuales, sino también con regiones regulatorias, organización cromosómica, expresión y relaciones entre diferentes elementos del ADN.

Evo 2 representa uno de los intentos más ambiciosos de llevar los modelos generativos a esa escala. Publicado en Nature en 2026, fue entrenado con aproximadamente nueve billones de pares de bases procedentes de organismos de todos los dominios de la vida y puede trabajar con contextos de hasta un millón de nucleótidos. El modelo mostró capacidad para predecir efectos de variantes genéticas y generar secuencias largas con características semejantes a las observadas en genomas naturales.

Evo 2 puede producir secuencias a escala genómica correspondientes a distintos dominios de la vida, y sus autores demostraron además experimentalmente algunos diseños regulatorios generados con ayuda del modelo. Sin embargo, esta distinción es fundamental: generar una secuencia larga con coherencia estadística y propiedades biológicas plausibles no equivale a crear un organismo funcional. Los propios autores reconocen que todavía carecemos de una comprensión suficiente de la complejidad codificada por los genomas como para componer de manera inteligente sistemas biológicos completamente nuevos.

Una secuencia puede parecer genómica, contener genes y patrones regulatorios reconocibles y resultar convincente para distintos modelos computacionales sin que, al sintetizarla e introducirla en una célula, produzca necesariamente un sistema viable, estable o predecible.

La célula mínima y una lección de humildad

La biología sintética ya había mostrado esa dificultad mucho antes de los actuales modelos generativos.

En 2016, investigadores del J. Craig Venter Institute construyeron JCVI-syn3.0, una célula bacteriana con un genoma sintético de aproximadamente 531.000 pares de bases y sólo 473 genes. Era una aproximación experimental a una célula mínima capaz de autorreplicarse.

El experimento resulta especialmente interesante por lo que salió mal. Un primer intento de diseñar el genoma mínimo a partir del conocimiento disponible no produjo una célula viable. Fueron necesarios tres ciclos de diseño, síntesis y prueba, apoyados en mejores experimentos de mutagénesis, para identificar genes que parecían prescindibles pero resultaban necesarios para un crecimiento robusto.

El resultado final conservó 473 genes y, de manera reveladora, 149 de ellos todavía no tenían entonces una función biológica conocida. Una década después, nuevas investigaciones continúan intentando determinar la función de parte de esos genes.

La enseñanza es difícil de ignorar. Podemos sintetizar físicamente un genoma, reducirlo a unos pocos cientos de genes y obtener una célula capaz de reproducirse, pero eso no significa que comprendamos completamente cómo todas sus partes producen un sistema vivo funcional. La inteligencia artificial puede acelerar ese proceso de aprendizaje y explorar combinaciones imposibles de evaluar manualmente, pero no elimina la complejidad emergente de la vida.

Entonces, ¿estamos diseñando vida?

La respuesta depende de qué entendamos por diseñar.

Hoy ya podemos generar proteínas funcionales con secuencias muy alejadas de las conocidas, proponer nuevos editores genéticos y producir largas secuencias de ADN con características genómicas plausibles. Pero son capacidades diferentes y no conviene colocarlas en el mismo nivel.

Una proteína sintetizada y validada experimentalmente demuestra una función molecular concreta. Una secuencia genómica generada por un modelo demuestra, en cambio, que el sistema aprendió regularidades del ADN a gran escala. No demuestra que haya creado un organismo.

Si por “diseñar vida” entendemos describir una función y recibir de una inteligencia artificial el genoma de un organismo completamente nuevo, sintetizarlo y obtener de manera predecible una célula viable con el comportamiento solicitado, todavía estamos lejos. Mucho más lejos aún se encuentra la idea de diseñar organismos multicelulares complejos de la misma forma en que hoy generamos una imagen mediante una instrucción de texto.

La diferencia no es sólo cuantitativa. Las propiedades de una célula emergen de redes de regulación, metabolismo, interacciones moleculares, estado epigenético y condiciones ambientales. En organismos multicelulares se agregan desarrollo, diferenciación, arquitectura de tejidos, inmunidad y una enorme cantidad de interacciones dinámicas. La secuencia de ADN es fundamental, pero no constituye por sí sola una descripción completa del sistema.

El laboratorio sigue teniendo la última palabra

Esta limitación explica por qué el futuro más inmediato probablemente no sea una IA que “fabrique vida” de manera autónoma, sino sistemas que cierren progresivamente el ciclo entre diseño computacional y experimentación.

Un modelo puede proponer miles de candidatos; herramientas de predicción pueden descartar muchos de ellos; un laboratorio automatizado sintetiza y prueba una selección; los resultados regresan al sistema y una nueva generación de diseños intenta mejorar lo anterior.

La transformación puede ser enorme aunque cada paso continúe requiriendo validación experimental. La ventaja de la inteligencia artificial no consiste necesariamente en acertar a la primera, sino en reducir un espacio de posibilidades prácticamente inabarcable mediante la exploración convencional.

El laboratorio deja así de ser únicamente el lugar donde se ejecuta una hipótesis concebida previamente por una persona y empieza a formar parte de un circuito iterativo entre algoritmos, robótica y experimentación. Ya vimos los primeros ejemplos de esta convergencia en el descubrimiento de medicamentos mediante inteligencia artificial. En biología generativa, sus consecuencias podrían ser todavía más profundas.

El problema del doble uso

Las mismas características que hacen atractiva a la biología generativa para desarrollar medicamentos, enzimas industriales, materiales o nuevas herramientas diagnósticas plantean inevitablemente un problema de bioseguridad. Una tecnología capaz de generar secuencias novedosas no tiene por qué limitarse a funciones beneficiosas.

Estamos frente a un ejemplo clásico de tecnología de doble uso: una misma capacidad puede tener aplicaciones legítimas y, bajo otras condiciones, usos perjudiciales.

Conviene evitar dos extremos. El primero consiste en asumir que una IA actual puede producir, a partir de una simple instrucción, cualquier organismo peligroso imaginable. La evidencia disponible no justifica esa imagen. Persisten barreras importantes de conocimiento, experimentación, síntesis, ensamblaje y validación.

El segundo extremo sería concluir que el riesgo puede ignorarse hasta que esas capacidades sean completas. Precisamente porque el progreso es gradual, los mecanismos de seguridad probablemente deban evolucionar junto con la capacidad tecnológica y no aparecer únicamente cuando el problema ya esté plenamente desarrollado.

Bioseguridad: cuando reconocer una secuencia deja de ser suficiente

Durante años, una parte importante de la bioseguridad asociada a la síntesis de ADN se apoyó en una idea razonable: comparar los pedidos de secuencias con bases de datos de agentes o toxinas conocidos y revisar aquellas coincidencias que pudieran representar un riesgo.

Ese enfoque continúa siendo útil, pero la biología generativa introduce una dificultad nueva. Dos proteínas pueden conservar funciones relacionadas aun cuando sus secuencias se hayan alejado considerablemente. Un sistema generativo puede, por lo tanto, explorar moléculas que mantengan determinadas propiedades biológicas sin parecerse demasiado a las secuencias que sirvieron como punto de partida.

En 2026, investigadores vinculados al National Institute of Standards and Technology de Estados Unidos plantearon precisamente este problema y propusieron complementar los actuales sistemas basados en similitud con métodos capaces de evaluar también funciones biológicas de preocupación.

Esto modifica la lógica de la seguridad. Ya no siempre bastará con preguntar: “¿esta secuencia se parece a algo peligroso conocido?”. En algunos contextos será necesario intentar responder una pregunta mucho más difícil: “¿qué podría hacer esta secuencia aunque nunca la hayamos visto antes?”.

¿Dónde deberían colocarse los controles?

No existe una única barrera capaz de resolver el problema. Un enfoque razonable probablemente necesite varias capas. Los modelos de mayor capacidad pueden incorporar restricciones y evaluaciones para usos de alto riesgo; los proveedores de síntesis pueden verificar clientes y analizar pedidos; las instituciones científicas pueden reforzar la revisión de investigaciones de doble uso; y los sistemas de cribado deberán evolucionar a medida que mejoren las herramientas capaces de predecir función.

También comienzan a aparecer propuestas más experimentales. El 30 de septiembre de 2026, Nature publicó SynthIDBio, una prueba de concepto para incorporar marcas detectables a proteínas y estructuras generadas por inteligencia artificial preservando su utilidad biológica. Los investigadores validaron experimentalmente proteínas de unión marcadas que mantuvieron afinidades comparables a las versiones no marcadas.

La idea resulta atractiva como herramienta de procedencia: permitiría reconocer que determinada proteína fue generada mediante un sistema concreto. Pero todavía no constituye un mecanismo de bioseguridad desplegado. Los propios investigadores la presentan como una prueba de concepto y reconocen la necesidad de estandarización y coordinación; además, la marca puede ser eliminada mediante determinadas manipulaciones. Debe entenderse, por lo tanto, como una posible capa adicional de trazabilidad y no como una solución independiente.

El desafío será encontrar proporcionalidad. Controles excesivamente amplios podrían dificultar investigación legítima en medicina, agricultura o biotecnología industrial sin impedir necesariamente un uso malicioso. Controles demasiado débiles podrían quedar rápidamente obsoletos frente a modelos capaces de explorar secuencias cada vez más alejadas de las conocidas.

Probablemente la discusión deba centrarse menos en prohibir herramientas genéricas y más en identificar combinaciones concretas de capacidad, acceso, síntesis y función que justifiquen distintos niveles de supervisión.

Una frontera que se mueve muy rápido

La expresión “biología generativa” puede sonar futurista, pero algunas de sus piezas fundamentales ya existen. Diseñamos proteínas de novo, generamos nuevos editores genéticos, producimos secuencias de ADN cada vez más largas y conectamos progresivamente el diseño computacional con la experimentación automatizada.

Ninguno de esos avances equivale todavía a dominar la vida como si fuera un lenguaje de programación perfectamente comprendido.

Tal vez la transformación más importante sea otra. Durante décadas, la biotecnología trabajó principalmente observando, seleccionando o modificando organismos y moléculas que la evolución ya había producido. Los modelos generativos permiten comenzar a explorar un espacio mucho mayor: aquellas secuencias y estructuras que podrían ser biológicamente posibles aunque nunca hayan aparecido en la historia natural.

Eso abre oportunidades extraordinarias. Nuevas proteínas podrían convertirse en medicamentos, sensores, materiales, enzimas industriales o herramientas para estudiar enfermedades. Los modelos genómicos podrían ayudarnos a comprender regiones del ADN cuya función todavía ignoramos. Y la combinación de generación computacional y experimentación automatizada podría reducir enormemente algunos ciclos de prueba y error.

Pero también modifica una pregunta fundamental.

Hasta ahora, gran parte de la biología consistía en intentar comprender qué había construido la evolución. Poco a poco estamos entrando en una etapa en la que también tendremos que decidir qué queremos construir nosotros.

Quizá ese sea el verdadero límite de la biología generativa. No estará determinado únicamente por aquello que una inteligencia artificial sea capaz de diseñar, sino también por aquello que consideremos razonable sintetizar, probar y, eventualmente, liberar al mundo.

Bibliografía

  1. Watson JL, Juergens D, Bennett NR, et al. De novo design of protein structure and function with RFdiffusion. Nature. 2023;620:1089–1100. doi:10.1038/s41586-023-06415-8.
  2. Hayes T, Rao R, Akin H, et al. Simulating 500 million years of evolution with a language model. Science. 2025;387:850–858. doi:10.1126/science.ads0018.
  3. Ruffolo JA, Nayfach S, Gallagher J, et al. Design of highly functional genome editors by modelling CRISPR–Cas sequences. Nature. 2025;645:518–525. doi:10.1038/s41586-025-09298-z.
  4. Brixi G, Durrant MG, Ku J, et al. Genome modelling and design across all domains of life with Evo 2. Nature. 2026;652:1349–1361. doi:10.1038/s41586-026-10176-5.
  5. Koh HY, Zheng Y, Yang M, et al. AI-driven protein design. Nature Reviews Bioengineering. 2025;3:1034–1056. doi:10.1038/s44222-025-00349-8.
  6. Yang W, Wang S, Lee GR, et al. The past, present and future of de novo protein design. Nature. 2026;652:1139–1152. doi:10.1038/s41586-026-10328-7.
  7. Hutchison CA III, Chuang RY, Noskov VN, et al. Design and synthesis of a minimal bacterial genome. Science. 2016;351:aad6253. PMID:27013737.
  8. Able G, Alexanian T, Beal J, et al. Beyond sequence similarity: toward function-based screening of nucleic acid synthesis. Frontiers in Bioengineering and Biotechnology. 2026. doi:10.3389/fbioe.2026.1832724.
  9. Wang M, Zhang Z, Bedi AS, et al. A call for built-in biosecurity safeguards for generative AI tools. Nature Biotechnology. 2025;43:845–847. doi:10.1038/s41587-025-02650-8.
  10. Stutz D, Cowen-Rivers AI, Ortiz-Jimenez G, et al. Function-preserving watermarking of AI-generated proteins. Nature. 2026. doi:10.1038/s41586-026-10965-y.