Biología generativa: cuando la IA empieza a diseñar vida

Biología generativa e inteligencia artificial: del código genético al diseño de proteínas y sistemas celulares

Durante buena parte de la historia de la biología moderna, el desafío fue aprender a leer. Primero secuenciamos genes; después comenzamos a relacionar esas secuencias con proteínas, estructuras y funciones. En los últimos años, herramientas como AlphaFold mostraron hasta qué punto la inteligencia artificial podía ayudarnos a comprender la arquitectura molecular de la vida. CRISPR dio un paso diferente: permitió modificar de manera dirigida parte de ese código.

Pero una nueva generación de modelos plantea una pregunta todavía más profunda. ¿Qué ocurre cuando una inteligencia artificial deja de limitarse a interpretar o modificar la biología existente y comienza a proponer moléculas, proteínas y secuencias que nunca existieron en la naturaleza?

Ese es el territorio de la biología generativa. El término reúne tecnologías diferentes, pero todas comparten una idea con la IA generativa que produce textos o imágenes: aprender regularidades a partir de enormes cantidades de datos y utilizarlas para generar algo nuevo. La diferencia es que aquí el resultado no es una frase ni una fotografía. Puede ser la secuencia de una proteína, un fragmento de ADN o, al menos en principio, una parte cada vez mayor de un sistema biológico.

La comparación debe utilizarse con cautela. Una imagen generada puede evaluarse inmediatamente en una pantalla. Una secuencia biológica puede parecer perfectamente plausible para un modelo y, sin embargo, no plegarse correctamente, no funcionar dentro de una célula, resultar tóxica o producir efectos inesperados. La biología está sometida a restricciones físicas, químicas y evolutivas que no desaparecen porque un algoritmo sea capaz de generar una secuencia convincente. Entre diseñar algo en una computadora y demostrar que funciona en un sistema vivo continúa existiendo una distancia experimental considerable.

De predecir proteínas a diseñarlas

El cambio puede entenderse observando lo ocurrido con las proteínas. AlphaFold convirtió la predicción de estructuras en una herramienta extraordinariamente poderosa, pero su pregunta fundamental era: dada una secuencia, ¿qué estructura probablemente adopte esta proteína? Los modelos generativos permiten invertir parcialmente el problema. Podemos comenzar con una estructura, una superficie de unión o determinada función y pedir al sistema que explore qué proteínas podrían cumplirla.

RFdiffusion fue uno de los hitos de esta transición. Publicado en Nature en 2023, adaptó el concepto de los modelos de difusión —popularizados por la generación de imágenes— al diseño de estructuras proteicas. El sistema produjo proteínas de novo, ensamblajes y moléculas diseñadas para unirse a blancos determinados, y numerosos diseños fueron sintetizados y evaluados experimentalmente. No se trataba simplemente de recuperar proteínas existentes de una base de datos, sino de explorar regiones del espacio molecular que la evolución conocida no había recorrido de esa manera.

Desde entonces, el campo avanzó rápidamente. Una revisión publicada en Nature en 2026 sostiene que algunos problemas clásicos del diseño de nuevas estructuras, ensamblajes y proteínas de unión están cerca de dejar de ser principalmente problemas de “cómo diseñar” para convertirse en problemas de “qué conviene diseñar”. La afirmación no significa que cualquier proteína imaginable pueda obtenerse a voluntad. Diseñar enzimas complejas, interruptores moleculares, sistemas con múltiples estados o verdaderas nanomáquinas continúa siendo considerablemente más difícil. Pero la frontera se desplazó.

Una proteína que la evolución nunca produjo

ESM3 ofrece otro ejemplo particularmente ilustrativo. Este modelo fue desarrollado para trabajar simultáneamente con secuencia, estructura y función de proteínas. En un trabajo publicado en Science en 2025, los investigadores le pidieron generar proteínas fluorescentes y sintetizaron algunas de sus propuestas. Entre ellas encontraron una proteína fluorescente funcional cuya secuencia presentaba apenas un 58 % de identidad con la proteína fluorescente conocida más cercana.

Los autores estimaron que esa distancia sería comparable a aproximadamente 500 millones de años de divergencia evolutiva. Es importante entender qué significa esa comparación: la computadora no reprodujo literalmente 500 millones de años de evolución. Se trata de una estimación basada en la distancia entre secuencias. Lo relevante es más concreto y, quizá, más interesante: un modelo entrenado con diversidad biológica fue capaz de proponer una proteína funcional muy distante de las secuencias naturales conocidas y, al sintetizarla, el laboratorio confirmó que efectivamente era fluorescente.

El mismo principio comienza a extenderse a las herramientas con las que intervenimos la biología. Como vimos al analizar CRISPR e inteligencia artificial, OpenCRISPR-1 mostró que un modelo generativo podía proponer un editor CRISPR-Cas funcional y muy alejado en secuencia de las Cas9 naturales de referencia. En células humanas mostró actividad de edición y compatibilidad con edición de bases. Aquí interesa menos repetir aquel experimento que advertir el cambio de escala: la inteligencia artificial ya no sólo selecciona entre herramientas biológicas existentes, sino que comienza a explorar versiones nuevas de esas herramientas.

¿Puede una IA escribir ADN?

El siguiente nivel es considerablemente más complejo. Las proteínas suelen contener cientos de aminoácidos; los genomas pueden contener desde cientos de miles hasta miles de millones de bases y su funcionamiento depende de relaciones que abarcan enormes distancias dentro de la secuencia. Modelar un genoma exige aprender regularidades relacionadas no sólo con genes individuales, sino también con regiones regulatorias, organización cromosómica, expresión y relaciones entre diferentes elementos del ADN.

Evo 2 representa uno de los intentos más ambiciosos de llevar los modelos generativos a esa escala. Publicado en Nature en 2026, fue entrenado con aproximadamente nueve billones de pares de bases procedentes de organismos de todos los dominios de la vida y puede trabajar con contextos de hasta un millón de nucleótidos. El modelo mostró capacidad para predecir efectos de variantes genéticas y generar secuencias largas con características semejantes a las observadas en genomas naturales.

Evo 2 puede producir secuencias a escala genómica correspondientes a distintos dominios de la vida, y sus autores demostraron además experimentalmente algunos diseños regulatorios generados con ayuda del modelo. Sin embargo, esta distinción es fundamental: generar una secuencia larga con coherencia estadística y propiedades biológicas plausibles no equivale a crear un organismo funcional. Los propios autores reconocen que todavía carecemos de una comprensión suficiente de la complejidad codificada por los genomas como para componer de manera inteligente sistemas biológicos completamente nuevos.

Una secuencia puede parecer genómica, contener genes y patrones regulatorios reconocibles y resultar convincente para distintos modelos computacionales sin que, al sintetizarla e introducirla en una célula, produzca necesariamente un sistema viable, estable o predecible.

La célula mínima y una lección de humildad

La biología sintética ya había mostrado esa dificultad mucho antes de los actuales modelos generativos.

En 2016, investigadores del J. Craig Venter Institute construyeron JCVI-syn3.0, una célula bacteriana con un genoma sintético de aproximadamente 531.000 pares de bases y sólo 473 genes. Era una aproximación experimental a una célula mínima capaz de autorreplicarse.

El experimento resulta especialmente interesante por lo que salió mal. Un primer intento de diseñar el genoma mínimo a partir del conocimiento disponible no produjo una célula viable. Fueron necesarios tres ciclos de diseño, síntesis y prueba, apoyados en mejores experimentos de mutagénesis, para identificar genes que parecían prescindibles pero resultaban necesarios para un crecimiento robusto.

El resultado final conservó 473 genes y, de manera reveladora, 149 de ellos todavía no tenían entonces una función biológica conocida. Una década después, nuevas investigaciones continúan intentando determinar la función de parte de esos genes.

La enseñanza es difícil de ignorar. Podemos sintetizar físicamente un genoma, reducirlo a unos pocos cientos de genes y obtener una célula capaz de reproducirse, pero eso no significa que comprendamos completamente cómo todas sus partes producen un sistema vivo funcional. La inteligencia artificial puede acelerar ese proceso de aprendizaje y explorar combinaciones imposibles de evaluar manualmente, pero no elimina la complejidad emergente de la vida.

Entonces, ¿estamos diseñando vida?

La respuesta depende de qué entendamos por diseñar.

Hoy ya podemos generar proteínas funcionales con secuencias muy alejadas de las conocidas, proponer nuevos editores genéticos y producir largas secuencias de ADN con características genómicas plausibles. Pero son capacidades diferentes y no conviene colocarlas en el mismo nivel.

Una proteína sintetizada y validada experimentalmente demuestra una función molecular concreta. Una secuencia genómica generada por un modelo demuestra, en cambio, que el sistema aprendió regularidades del ADN a gran escala. No demuestra que haya creado un organismo.

Si por “diseñar vida” entendemos describir una función y recibir de una inteligencia artificial el genoma de un organismo completamente nuevo, sintetizarlo y obtener de manera predecible una célula viable con el comportamiento solicitado, todavía estamos lejos. Mucho más lejos aún se encuentra la idea de diseñar organismos multicelulares complejos de la misma forma en que hoy generamos una imagen mediante una instrucción de texto.

La diferencia no es sólo cuantitativa. Las propiedades de una célula emergen de redes de regulación, metabolismo, interacciones moleculares, estado epigenético y condiciones ambientales. En organismos multicelulares se agregan desarrollo, diferenciación, arquitectura de tejidos, inmunidad y una enorme cantidad de interacciones dinámicas. La secuencia de ADN es fundamental, pero no constituye por sí sola una descripción completa del sistema.

El laboratorio sigue teniendo la última palabra

Esta limitación explica por qué el futuro más inmediato probablemente no sea una IA que “fabrique vida” de manera autónoma, sino sistemas que cierren progresivamente el ciclo entre diseño computacional y experimentación.

Un modelo puede proponer miles de candidatos; herramientas de predicción pueden descartar muchos de ellos; un laboratorio automatizado sintetiza y prueba una selección; los resultados regresan al sistema y una nueva generación de diseños intenta mejorar lo anterior.

La transformación puede ser enorme aunque cada paso continúe requiriendo validación experimental. La ventaja de la inteligencia artificial no consiste necesariamente en acertar a la primera, sino en reducir un espacio de posibilidades prácticamente inabarcable mediante la exploración convencional.

El laboratorio deja así de ser únicamente el lugar donde se ejecuta una hipótesis concebida previamente por una persona y empieza a formar parte de un circuito iterativo entre algoritmos, robótica y experimentación. Ya vimos los primeros ejemplos de esta convergencia en el descubrimiento de medicamentos mediante inteligencia artificial. En biología generativa, sus consecuencias podrían ser todavía más profundas.

El problema del doble uso

Las mismas características que hacen atractiva a la biología generativa para desarrollar medicamentos, enzimas industriales, materiales o nuevas herramientas diagnósticas plantean inevitablemente un problema de bioseguridad. Una tecnología capaz de generar secuencias novedosas no tiene por qué limitarse a funciones beneficiosas.

Estamos frente a un ejemplo clásico de tecnología de doble uso: una misma capacidad puede tener aplicaciones legítimas y, bajo otras condiciones, usos perjudiciales.

Conviene evitar dos extremos. El primero consiste en asumir que una IA actual puede producir, a partir de una simple instrucción, cualquier organismo peligroso imaginable. La evidencia disponible no justifica esa imagen. Persisten barreras importantes de conocimiento, experimentación, síntesis, ensamblaje y validación.

El segundo extremo sería concluir que el riesgo puede ignorarse hasta que esas capacidades sean completas. Precisamente porque el progreso es gradual, los mecanismos de seguridad probablemente deban evolucionar junto con la capacidad tecnológica y no aparecer únicamente cuando el problema ya esté plenamente desarrollado.

Bioseguridad: cuando reconocer una secuencia deja de ser suficiente

Durante años, una parte importante de la bioseguridad asociada a la síntesis de ADN se apoyó en una idea razonable: comparar los pedidos de secuencias con bases de datos de agentes o toxinas conocidos y revisar aquellas coincidencias que pudieran representar un riesgo.

Ese enfoque continúa siendo útil, pero la biología generativa introduce una dificultad nueva. Dos proteínas pueden conservar funciones relacionadas aun cuando sus secuencias se hayan alejado considerablemente. Un sistema generativo puede, por lo tanto, explorar moléculas que mantengan determinadas propiedades biológicas sin parecerse demasiado a las secuencias que sirvieron como punto de partida.

En 2026, investigadores vinculados al National Institute of Standards and Technology de Estados Unidos plantearon precisamente este problema y propusieron complementar los actuales sistemas basados en similitud con métodos capaces de evaluar también funciones biológicas de preocupación.

Esto modifica la lógica de la seguridad. Ya no siempre bastará con preguntar: “¿esta secuencia se parece a algo peligroso conocido?”. En algunos contextos será necesario intentar responder una pregunta mucho más difícil: “¿qué podría hacer esta secuencia aunque nunca la hayamos visto antes?”.

¿Dónde deberían colocarse los controles?

No existe una única barrera capaz de resolver el problema. Un enfoque razonable probablemente necesite varias capas. Los modelos de mayor capacidad pueden incorporar restricciones y evaluaciones para usos de alto riesgo; los proveedores de síntesis pueden verificar clientes y analizar pedidos; las instituciones científicas pueden reforzar la revisión de investigaciones de doble uso; y los sistemas de cribado deberán evolucionar a medida que mejoren las herramientas capaces de predecir función.

También comienzan a aparecer propuestas más experimentales. El 30 de septiembre de 2026, Nature publicó SynthIDBio, una prueba de concepto para incorporar marcas detectables a proteínas y estructuras generadas por inteligencia artificial preservando su utilidad biológica. Los investigadores validaron experimentalmente proteínas de unión marcadas que mantuvieron afinidades comparables a las versiones no marcadas.

La idea resulta atractiva como herramienta de procedencia: permitiría reconocer que determinada proteína fue generada mediante un sistema concreto. Pero todavía no constituye un mecanismo de bioseguridad desplegado. Los propios investigadores la presentan como una prueba de concepto y reconocen la necesidad de estandarización y coordinación; además, la marca puede ser eliminada mediante determinadas manipulaciones. Debe entenderse, por lo tanto, como una posible capa adicional de trazabilidad y no como una solución independiente.

El desafío será encontrar proporcionalidad. Controles excesivamente amplios podrían dificultar investigación legítima en medicina, agricultura o biotecnología industrial sin impedir necesariamente un uso malicioso. Controles demasiado débiles podrían quedar rápidamente obsoletos frente a modelos capaces de explorar secuencias cada vez más alejadas de las conocidas.

Probablemente la discusión deba centrarse menos en prohibir herramientas genéricas y más en identificar combinaciones concretas de capacidad, acceso, síntesis y función que justifiquen distintos niveles de supervisión.

Una frontera que se mueve muy rápido

La expresión “biología generativa” puede sonar futurista, pero algunas de sus piezas fundamentales ya existen. Diseñamos proteínas de novo, generamos nuevos editores genéticos, producimos secuencias de ADN cada vez más largas y conectamos progresivamente el diseño computacional con la experimentación automatizada.

Ninguno de esos avances equivale todavía a dominar la vida como si fuera un lenguaje de programación perfectamente comprendido.

Tal vez la transformación más importante sea otra. Durante décadas, la biotecnología trabajó principalmente observando, seleccionando o modificando organismos y moléculas que la evolución ya había producido. Los modelos generativos permiten comenzar a explorar un espacio mucho mayor: aquellas secuencias y estructuras que podrían ser biológicamente posibles aunque nunca hayan aparecido en la historia natural.

Eso abre oportunidades extraordinarias. Nuevas proteínas podrían convertirse en medicamentos, sensores, materiales, enzimas industriales o herramientas para estudiar enfermedades. Los modelos genómicos podrían ayudarnos a comprender regiones del ADN cuya función todavía ignoramos. Y la combinación de generación computacional y experimentación automatizada podría reducir enormemente algunos ciclos de prueba y error.

Pero también modifica una pregunta fundamental.

Hasta ahora, gran parte de la biología consistía en intentar comprender qué había construido la evolución. Poco a poco estamos entrando en una etapa en la que también tendremos que decidir qué queremos construir nosotros.

Quizá ese sea el verdadero límite de la biología generativa. No estará determinado únicamente por aquello que una inteligencia artificial sea capaz de diseñar, sino también por aquello que consideremos razonable sintetizar, probar y, eventualmente, liberar al mundo.

Bibliografía

  1. Watson JL, Juergens D, Bennett NR, et al. De novo design of protein structure and function with RFdiffusion. Nature. 2023;620:1089–1100. doi:10.1038/s41586-023-06415-8.
  2. Hayes T, Rao R, Akin H, et al. Simulating 500 million years of evolution with a language model. Science. 2025;387:850–858. doi:10.1126/science.ads0018.
  3. Ruffolo JA, Nayfach S, Gallagher J, et al. Design of highly functional genome editors by modelling CRISPR–Cas sequences. Nature. 2025;645:518–525. doi:10.1038/s41586-025-09298-z.
  4. Brixi G, Durrant MG, Ku J, et al. Genome modelling and design across all domains of life with Evo 2. Nature. 2026;652:1349–1361. doi:10.1038/s41586-026-10176-5.
  5. Koh HY, Zheng Y, Yang M, et al. AI-driven protein design. Nature Reviews Bioengineering. 2025;3:1034–1056. doi:10.1038/s44222-025-00349-8.
  6. Yang W, Wang S, Lee GR, et al. The past, present and future of de novo protein design. Nature. 2026;652:1139–1152. doi:10.1038/s41586-026-10328-7.
  7. Hutchison CA III, Chuang RY, Noskov VN, et al. Design and synthesis of a minimal bacterial genome. Science. 2016;351:aad6253. PMID:27013737.
  8. Able G, Alexanian T, Beal J, et al. Beyond sequence similarity: toward function-based screening of nucleic acid synthesis. Frontiers in Bioengineering and Biotechnology. 2026. doi:10.3389/fbioe.2026.1832724.
  9. Wang M, Zhang Z, Bedi AS, et al. A call for built-in biosecurity safeguards for generative AI tools. Nature Biotechnology. 2025;43:845–847. doi:10.1038/s41587-025-02650-8.
  10. Stutz D, Cowen-Rivers AI, Ortiz-Jimenez G, et al. Function-preserving watermarking of AI-generated proteins. Nature. 2026. doi:10.1038/s41586-026-10965-y.

CRISPR + IA: de comprender el código biológico a poder modificarlo

Ilustración de una proteína CRISPR sobre una doble hélice de ADN, conectada a una red digital con forma de rostro.

Durante décadas, uno de los grandes objetivos de la biología fue aprender a leer el código de la vida. Primero pudimos secuenciar genes y, con el tiempo, comenzamos a comprender mejor cómo esas secuencias producen proteínas, cómo se regula su actividad y de qué manera determinadas variantes pueden contribuir al desarrollo de enfermedades. En los últimos años, sin embargo, estamos entrando en una etapa diferente: además de leer e interpretar ese código, empezamos a disponer de herramientas capaces de modificarlo de manera dirigida.

CRISPR fue uno de los grandes saltos que hicieron posible esa transición. La inteligencia artificial puede convertirse en el siguiente.

La combinación entre ambas tecnologías ya está modificando la investigación en edición genética. Los algoritmos pueden ayudar a elegir dónde intervenir en el ADN, anticipar posibles modificaciones no deseadas, seleccionar mejores ARN guía y analizar las consecuencias funcionales de determinadas variantes. Más recientemente, los modelos generativos comenzaron incluso a diseñar nuevas proteínas de edición genética muy diferentes de las nucleasas naturales conocidas.

Este cambio se conecta con otra transformación que ya analizamos en Doctor Digital: el uso de AlphaFold 3 y modelos generativos para comprender interacciones moleculares y diseñar nuevas moléculas. La biología computacional dejó de utilizarse solamente para analizar datos obtenidos en el laboratorio y empieza también a participar en el diseño de nuevas intervenciones biológicas. Sin embargo, entre predecir una modificación y demostrar que funciona de manera segura existe todavía una enorme distancia. La inteligencia artificial puede reducir el espacio de búsqueda, orientar los experimentos y proponer soluciones novedosas, pero la biología continúa teniendo la última palabra.

Qué es CRISPR y por qué cambió la genética

CRISPR surgió en la naturaleza como parte de sistemas de defensa adaptativa presentes en bacterias y arqueas frente a virus y otros elementos genéticos invasores. Estos microorganismos pueden incorporar pequeños fragmentos del material genético del invasor y utilizarlos posteriormente como una especie de memoria molecular que permite reconocerlo.

El descubrimiento de que determinadas proteínas asociadas a CRISPR podían ser dirigidas mediante ARN hacia secuencias específicas de ADN permitió transformar ese mecanismo natural en una herramienta programable de ingeniería genética. Uno de los trabajos fundamentales fue publicado en Science en 2012 por Martin Jinek, Emmanuelle Charpentier, Jennifer Doudna y colaboradores, quienes demostraron que Cas9 podía ser programada mediante ARN para producir cortes en secuencias específicas de ADN.

El sistema experimental CRISPR-Cas9 utilizado habitualmente puede simplificarse en dos componentes principales: una proteína Cas9, capaz de cortar ADN, y un ARN guía que la dirige hacia una región determinada del genoma.

Cuando la secuencia del ARN guía reconoce suficientemente bien la región elegida, Cas9 puede producir una rotura de doble cadena. La célula intenta reparar posteriormente ese daño mediante sus propios mecanismos. Esa reparación puede aprovecharse para inactivar genes y, cuando se combina con plantillas de reparación u otras estrategias, también para introducir modificaciones dirigidas.

Con el tiempo aparecieron tecnologías considerablemente más sofisticadas. Los editores de bases utilizan componentes derivados de CRISPR combinados con otras enzimas para modificar determinadas bases sin necesidad de producir una rotura completa de las dos cadenas del ADN.

La edición primaria, conocida como prime editing, amplió todavía más las posibilidades. Utiliza una Cas9 modificada, una transcriptasa reversa y un ARN guía especializado denominado pegRNA, capaz de especificar tanto el sitio de edición como la modificación deseada. El trabajo original demostró inserciones, deleciones y los doce tipos posibles de sustitución puntual sin requerir una rotura de doble cadena ni una plantilla de ADN donante separada.

Por eso, describir CRISPR simplemente como unas “tijeras genéticas” comienza a resultar insuficiente. En realidad, se está convirtiendo en una plataforma programable de edición molecular y, cuanto más programable se vuelve una tecnología, mayor es el espacio en el que puede intervenir la inteligencia artificial.

El problema de elegir dónde editar

Saber que un determinado gen está relacionado con una enfermedad no significa que cualquier intervención sobre él vaya a resultar eficaz o segura. El genoma humano contiene aproximadamente 3.000 millones de pares de bases y muchas regiones presentan secuencias parcialmente similares. Un ARN guía diseñado para reconocer un sitio determinado puede, en determinadas condiciones, interactuar también con otras regiones.

Estas modificaciones no deseadas se conocen como efectos fuera del objetivo, o off-target. Algunas pueden carecer de consecuencias importantes, pero otras podrían alterar genes o regiones reguladoras relevantes.

Por eso, uno de los primeros campos en los que comenzaron a utilizarse técnicas de aprendizaje automático fue precisamente el diseño de los ARN guía. Los modelos pueden analizar grandes cantidades de experimentos previos y aprender qué características de una secuencia se asocian con una edición más eficiente. Al mismo tiempo, pueden recorrer el genoma buscando regiones suficientemente parecidas como para representar posibles sitios de unión no deseada.

Actualmente existen numerosos algoritmos destinados a estimar dos propiedades fundamentales: la eficiencia, es decir, la probabilidad de que la edición ocurra en el sitio buscado, y la especificidad, relacionada con la capacidad de evitar modificaciones en otras regiones.

Una revisión publicada en Nature Reviews Genetics, cuyo número impreso corresponde a 2026, describe precisamente el diseño de ARN guía, la predicción de actividad on-target y off-target, la ingeniería de proteínas editoras y el descubrimiento de nuevas enzimas como algunos de los principales campos en los que la inteligencia artificial está empezando a transformar la edición genética.

Esto no significa que una computadora pueda garantizar que una edición será segura. Las predicciones dependen de los datos utilizados para entrenar los modelos, del sistema CRISPR empleado, del tipo celular y del contexto biológico. Su función es más concreta y, al mismo tiempo, enormemente útil: permitir que los experimentos comiencen con candidatos mejor seleccionados.

Comprender qué ocurre cuando cambiamos el ADN

Elegir correctamente dónde editar es sólo una parte del problema. Antes de modificar una secuencia también necesitamos comprender qué consecuencias podría tener ese cambio.

Durante mucho tiempo resultó relativamente más sencillo interpretar algunas variantes que alteraban directamente la estructura de una proteína. Mucho más difícil ha sido comprender las variantes presentes en las regiones no codificantes del ADN, que constituyen la mayor parte del genoma y contienen numerosos elementos responsables de regular cuándo, dónde y con qué intensidad se expresan los genes.

Aquí están apareciendo modelos capaces de aprender relaciones entre secuencia y función. Uno de los ejemplos más importantes es AlphaGenome, desarrollado por Google DeepMind y publicado en Nature en enero de 2026.

AlphaGenome puede analizar regiones de hasta aproximadamente un millón de pares de bases y generar predicciones sobre numerosos procesos regulatorios, entre ellos expresión génica, accesibilidad de la cromatina, modificaciones de histonas, unión de factores de transcripción, procesamiento del ARN y contactos de cromatina. En las evaluaciones publicadas, igualó o superó a los modelos externos comparados en 25 de 26 conjuntos de pruebas destinados a predecir el efecto de variantes.

AlphaGenome no es un sistema CRISPR y no modifica genes. Su relevancia para la edición genética aparece en una etapa anterior: puede ayudar a modelar cómo una determinada variante se relaciona con cambios funcionales en el genoma.

Esta distinción es importante. CRISPR proporciona una herramienta para realizar una modificación, pero decidir cuál modificación tiene sentido requiere comprender mejor el funcionamiento de las secuencias que queremos cambiar. La inteligencia artificial empieza así a conectar dos problemas que tradicionalmente se abordaban de manera separada: interpretar una variante y anticipar las consecuencias de modificarla.

Esquema de una variante de ADN y señales de cromatina, factores de transcripción y expresión génica analizadas mediante IA.
Esquema ilustrativo de predicción de efectos regulatorios de una variante; las señales y flechas no corresponden a resultados experimentales.

La IA puede mejorar las herramientas CRISPR

La inteligencia artificial no sólo puede utilizarse para elegir mejores lugares de edición. También puede aplicarse a las propias proteínas que realizan esas modificaciones.

Las nucleasas Cas utilizadas habitualmente fueron descubiertas inicialmente en microorganismos. Cas9, Cas12 y otras proteínas forman parte de sistemas biológicos que evolucionaron durante millones de años. Una vez identificadas, los investigadores comenzaron a modificarlas mediante ingeniería molecular con distintos objetivos: mejorar su precisión, modificar las secuencias que pueden reconocer, reducir su tamaño o adaptarlas a nuevos sistemas de edición.

Los modelos generativos de proteínas ofrecen una estrategia complementaria. Al analizar enormes cantidades de secuencias, pueden aprender regularidades relacionadas con la estructura y la función de estas moléculas. De una manera conceptualmente similar a cómo un modelo de lenguaje aprende relaciones entre palabras y frases a partir de grandes corpus de texto, un modelo de proteínas puede aprender qué combinaciones de aminoácidos son compatibles con determinadas arquitecturas moleculares.

Una vez entrenado, el sistema puede generar secuencias nuevas, algunas de ellas considerablemente alejadas de las proteínas naturales conocidas. Esto conecta directamente CRISPR con la biología generativa, en la que la computadora deja de limitarse a clasificar o predecir propiedades de moléculas existentes y comienza también a proponer nuevas moléculas candidatas.

OpenCRISPR-1 y los editores diseñados por IA

Uno de los ejemplos más importantes de esta convergencia es OpenCRISPR-1.

El sistema fue presentado inicialmente como preprint en 2024 y posteriormente publicado en Nature el 30 de julio de 2025. En ese trabajo, investigadores de Profluent desarrollaron modelos de lenguaje de proteínas entrenados a partir de un conjunto que incluía más de un millón de operones CRISPR obtenidos mediante el análisis de aproximadamente 26 terabases de genomas y metagenomas.

Los modelos generaron millones de secuencias candidatas pertenecientes a distintas familias CRISPR-Cas. Varios de los editores obtenidos mostraron actividad y especificidad comparables o superiores a SpCas9, a pesar de encontrarse aproximadamente a 400 mutaciones de distancia de esta proteína en términos de secuencia.

Uno de ellos fue denominado OpenCRISPR-1. Los investigadores demostraron que podía editar ADN en células humanas y que también era compatible con sistemas de edición de bases.

El trabajo resulta especialmente relevante porque demuestra que los modelos generativos pueden explorar regiones del espacio de secuencias muy alejadas de las proteínas naturales conocidas y generar moléculas que conservan una función biológica útil. No es necesario afirmar que esas regiones “nunca fueron recorridas por la evolución”, algo que no podemos demostrar; basta con señalar que muchas de las secuencias propuestas son muy diferentes de las proteínas que conocemos actualmente.

El concepto es probablemente más importante que una proteína particular. Durante décadas, gran parte de la biotecnología siguió una estrategia basada en descubrir herramientas interesantes en la naturaleza y modificarlas posteriormente. La biología generativa introduce otra posibilidad: partir de determinadas propiedades deseadas y utilizar modelos computacionales para proponer moléculas candidatas.

Después será necesario sintetizarlas, probarlas y compararlas experimentalmente. La computadora no elimina el laboratorio, pero puede ayudar a decidir qué pequeñas regiones de un espacio molecular gigantesco merece la pena explorar.

Modelos digitales de proteínas convergen en una nucleasa azul y violeta asociada a una cadena de ADN.
Los modelos generativos proponen proteínas editoras que después deben sintetizarse y validarse en el laboratorio.

La validación independiente de OpenCRISPR-1

Una cuestión especialmente importante en ciencia es saber si un resultado puede reproducirse fuera del grupo que desarrolló originalmente la tecnología.

En mayo de 2026, investigadores independientes publicaron en Genome Medicine una evaluación de OpenCRISPR-1 en diferentes sistemas de edición. El trabajo mostró que esta nucleasa podía mantener una actividad on-target comparable con SpCas9 en distintos loci y, al mismo tiempo, presentar una reducción importante de determinadas actividades off-target. Los investigadores también demostraron su utilización en estrategias de prime editing.

Esta validación independiente refuerza la idea de que los editores diseñados mediante modelos generativos no constituyen solamente una demostración computacional. Al menos algunos pueden funcionar como herramientas experimentales reales.

Esto no implica que OpenCRISPR-1 vaya a reemplazar a Cas9 ni que todos los editores generados por inteligencia artificial sean necesariamente mejores. La relevancia del ejemplo radica en demostrar que la generación computacional de nucleasas funcionales es técnicamente posible y puede producir moléculas con propiedades útiles.

De AlphaFold a la edición del genoma

Estas tecnologías suelen presentarse de manera separada, aunque en realidad comienzan a formar parte de un mismo proceso.

Modelos como AlphaFold ayudan a predecir estructuras de proteínas y, con nuevas generaciones de modelos, también determinadas interacciones moleculares. Los modelos genómicos intentan relacionar secuencias de ADN con regulación y función. Los algoritmos especializados en CRISPR pueden seleccionar ARN guía y anticipar posibles sitios fuera del objetivo, mientras que los modelos generativos de proteínas comienzan a diseñar nuevas herramientas moleculares.

CRISPR agrega a todo ese conocimiento una capacidad particularmente poderosa: intervenir físicamente sobre el genoma.

El resultado es una integración progresiva entre comprensión y manipulación. En un futuro, distintos modelos podrían contribuir a identificar una variante potencialmente patogénica, estimar cómo altera la función de un gen, comparar estrategias para corregirla y seleccionar una herramienta de edición adecuada. Otros sistemas podrían analizar posibles efectos no deseados o incluso proponer versiones modificadas de la propia proteína utilizada para realizar la intervención.

Cada etapa seguiría necesitando validación experimental, pero la cantidad de decisiones que pueden ser asistidas computacionalmente aumenta rápidamente. La inteligencia artificial deja así de ser solamente una herramienta para interpretar experimentos y empieza a participar en el proceso de diseño experimental.

¿Puede una IA diseñar una terapia genética?

Algunos de los componentes necesarios para hacerlo ya existen, aunque eso no significa que podamos automatizar el desarrollo completo de una terapia.

Los modelos pueden ayudar a identificar blancos, priorizar ARN guía, estimar riesgo off-target, interpretar variantes y optimizar proteínas. Sin embargo, convertir una estrategia de edición en un tratamiento eficaz exige resolver problemas que van mucho más allá de la secuencia del ADN.

Una modificación que funciona correctamente en una línea celular puede comportarse de manera diferente en otro tejido. También es necesario determinar cómo llevar el editor hasta las células adecuadas, durante cuánto tiempo permanecerá activo, qué proporción de células será modificada y cuál será la respuesta inmunológica del organismo.

Además, la biología no puede reducirse a una colección de secuencias independientes. Genes, proteínas, metabolismo, ambiente celular y señales provenientes de otros tejidos interactúan de manera permanente.

Por este motivo, otra frontera de investigación se orienta hacia los llamados modelos celulares virtuales, que intentan predecir cómo responderá una célula frente a determinadas perturbaciones. Su eventual integración con CRISPR podría mejorar nuestra capacidad para anticipar las consecuencias de una intervención, aunque todavía estamos hablando de un área de investigación emergente y no de una tecnología clínica establecida.

Menos experimentos, pero mejor seleccionados

Uno de los impactos más importantes de la inteligencia artificial sobre la biología probablemente no sea reemplazar los experimentos, sino ayudarnos a elegir cuáles vale la pena realizar.

El número de combinaciones posibles en biología molecular es extraordinariamente grande. Podemos diseñar miles de ARN guía contra un mismo conjunto de genes y millones de variantes diferentes de una proteína. Si además consideramos combinaciones entre mutaciones, contextos celulares y estrategias de administración, el espacio experimental se vuelve prácticamente imposible de recorrer mediante prueba y error.

Los modelos permiten reducir ese universo. A partir de millones de posibilidades pueden seleccionar algunos miles de candidatos y, posteriormente, priorizar un conjunto mucho menor para llevar al laboratorio.

Cuando esos experimentos generan nuevos datos, la información puede incorporarse nuevamente a los modelos y mejorar las predicciones futuras. Se forma así un ciclo en el que simulación y experimentación se retroalimentan continuamente.

Este mecanismo posiblemente sea uno de los cambios más profundos que introduzca la inteligencia artificial en la investigación biomédica. No elimina la experimentación; modifica la manera de decidir qué experimentar. En lugar de recorrer enormes espacios de posibilidades casi a ciegas, los investigadores pueden concentrar recursos sobre regiones previamente priorizadas mediante predicciones computacionales.

El límite sigue siendo la biología real

La velocidad con la que avanzan estos modelos puede producir una impresión engañosa. Generar una secuencia molecular plausible no demuestra que una proteína funcione, del mismo modo que predecir un bajo riesgo de efectos fuera del objetivo no garantiza que una edición vaya a comportarse exactamente como esperamos dentro de un organismo.

Los modelos de inteligencia artificial aprenden a partir de los datos disponibles. Si determinados tejidos, tipos celulares, mecanismos moleculares o poblaciones están insuficientemente representados, sus predicciones también pueden resultar menos fiables en esos contextos.

Además, incluso un modelo muy preciso trabaja necesariamente con una representación incompleta de la realidad. Ninguna simulación actual reproduce todas las interacciones que tienen lugar en una célula y mucho menos en un organismo completo.

La validación experimental continúa siendo, por lo tanto, el árbitro final. Los modelos pueden establecer prioridades, detectar patrones difíciles de reconocer y generar hipótesis novedosas, pero cada nueva herramienta de edición deberá demostrar experimentalmente que funciona y que lo hace con un margen de seguridad aceptable.

La diferencia entre predicción y demostración será cada vez más importante a medida que la inteligencia artificial pueda producir moléculas, estrategias de edición e hipótesis biológicas a una velocidad muy superior a nuestra capacidad para comprobarlas.

Una tecnología que también plantea límites éticos

La combinación entre inteligencia artificial y edición genética amplifica algunas de las preguntas que CRISPR ya había planteado por sí sola.

No es equivalente corregir una mutación en células somáticas de una persona con una enfermedad grave que introducir modificaciones heredables en embriones humanos. Tampoco tienen las mismas implicancias utilizar estas herramientas para tratar una enfermedad que emplearlas con el objetivo de modificar características humanas sin una indicación médica.

A medida que el diseño molecular se vuelva más accesible, será necesario discutir simultáneamente seguridad, regulación, acceso y mecanismos de supervisión. La inteligencia artificial puede disminuir algunas barreras técnicas, pero no resuelve las preguntas sociales y éticas relacionadas con aquello que consideramos aceptable modificar.

También existe un problema de distribución. Las terapias avanzadas pueden ser científicamente extraordinarias y, al mismo tiempo, resultar inaccesibles para gran parte de la población debido a su costo y complejidad. La verdadera dimensión de esta revolución no dependerá solamente de cuántas enfermedades puedan ser abordadas mediante edición genética, sino también de quiénes podrán beneficiarse de ella.

La capacidad técnica para realizar una modificación nunca determina por sí sola que debamos realizarla. Cuanto más poderosas se vuelvan estas herramientas, más importante será conservar esa distinción.

De comprender la vida a poder modificarla

La revolución genómica comenzó permitiéndonos leer el ADN. CRISPR proporcionó después una de las primeras herramientas verdaderamente programables para modificarlo y la inteligencia artificial está empezando a conectar ambas capacidades.

Los nuevos modelos genómicos intentan predecir qué significan determinadas secuencias y anticipar las consecuencias funcionales de ciertas variantes. Los algoritmos especializados en CRISPR ayudan a seleccionar dónde intervenir y a reducir el riesgo de modificaciones no deseadas. Al mismo tiempo, los modelos generativos empiezan a diseñar nuevas proteínas que podrían convertirse en herramientas moleculares de una próxima generación de editores.

Todavía estamos lejos de disponer de un sistema al que podamos describir una enfermedad y que automáticamente produzca una modificación genética segura y eficaz. Sin embargo, varias de las piezas necesarias para construir procesos mucho más asistidos por inteligencia artificial ya empiezan a existir.

Esto marca un cambio conceptual importante. La inteligencia artificial aplicada a la biología está dejando de ser únicamente una tecnología destinada a observar, clasificar y predecir fenómenos biológicos. También empieza a convertirse en una herramienta capaz de participar en el diseño de nuevas moléculas y nuevas intervenciones.

Este proceso forma parte de una transformación más amplia de la medicina y la investigación biomédica, en la que la inteligencia artificial empieza a integrarse en tareas clínicas, científicas y de gestión del conocimiento, aunque siempre con la necesidad de validación y supervisión humana.

Durante muchos años nos preguntamos hasta dónde podría llegar una computadora en su intento de comprender el código de la vida. La aparición de CRISPR, los modelos genómicos y la biología generativa agrega ahora una pregunta mucho más profunda: hasta dónde estaremos dispuestos a utilizar ese conocimiento para reescribirlo.

Fuentes y lecturas recomendadas

  • Thomson T, Li G, Strilchuk A, et al. Harnessing artificial intelligence to advance CRISPR-based genome editing technologies. Nature Reviews Genetics. 2026;27:212–230. DOI: 10.1038/s41576-025-00907-1. Nature Reviews Genetics.
  • Ruffolo JA, Nayfach S, Gallagher J, et al. Design of highly functional genome editors by modelling CRISPR–Cas sequences. Nature. 2025;645:518–525. DOI: 10.1038/s41586-025-09298-z. Nature.
  • Hwang HY, Yi H, Gwon Y, et al. High-fidelity genome and prime editing enabled by the AI-designed OpenCRISPR-1. Genome Medicine. 2026;18:109. DOI: 10.1186/s13073-026-01682-2. Genome Medicine.
  • Avsec Ž, Latysheva N, Cheng J, et al. Advancing regulatory variant effect prediction with AlphaGenome. Nature. 2026;649:1206–1218. DOI: 10.1038/s41586-025-10014-0. Nature.
  • Anzalone AV, Randolph PB, Davis JR, et al. Search-and-replace genome editing without double-strand breaks or donor DNA. Nature. 2019;576:149–157. DOI: 10.1038/s41586-019-1711-4. Nature.
  • Jinek M, Chylinski K, Fonfara I, et al. A programmable dual-RNA-guided DNA endonuclease in adaptive bacterial immunity. Science. 2012;337:816–821. DOI: 10.1126/science.1225829. Science.
  • Rees HA, Liu DR. Base editing: precision chemistry on the genome and transcriptome of living cells. Nature Reviews Genetics. 2018;19:770–788. DOI: 10.1038/s41576-018-0059-1. PubMed.
  • Advancing CRISPR with deep learning: a comprehensive review of models and databases. Molecular Therapy – Nucleic Acids. 2025;36:102691. DOI: 10.1016/j.omtn.2025.102691. ScienceDirect.