Investigadores de Apple han publicado un modelo de IA para diseño de proteínas llamado SimpleDesign. Lo que lo distingue es que puede generar a la vez la secuencia de aminoácidos de una proteína y su estructura tridimensional.

El trabajo apareció en la página de Apple Machine Learning Research y cuestiona una costumbre asentada en el campo.

Por qué hay que generar ambas cosas juntas

La función de una proteína no depende solo del orden de sus aminoácidos. La forma que adopta la cadena en el espacio es al menos tan decisiva como ese orden.

Por eso, al diseñar una proteína nueva, la relación entre secuencia y estructura debe tratarse en conjunto. Generar bien cada una por separado no significa haber producido un todo coherente.

El paso que se eliminó

Parte de los métodos generativos actuales funcionan en dos etapas. Primero un autocodificador convierte la estructura y la secuencia en símbolos latentes, y después el modelo generativo aprende en ese espacio comprimido.

El equipo de Apple sostiene que ese proceso en varias etapas no es obligatorio. En vez de comprimir antes los datos con un codificador aparte, SimpleDesign se entrena de extremo a extremo directamente sobre secuencias y estructuras.

EnfoqueFlujo
Método asentadoRepresentación latente con autocodificador y luego generación
SimpleDesignEntrenamiento directo de extremo a extremo sobre secuencia y estructura
ResultadoDesaparece una etapa y la información que se pierde en ella

El montaje en dos etapas tiene un coste: durante la compresión se pierde información y el modelo generativo ya no ve los datos crudos sino su forma comprimida. Quitar la capa intermedia elimina esa pérdida.

Cómo funciona por dentro

SimpleDesign procesa los dos tipos de datos dentro del mismo modelo pero usa caminos de cálculo distintos para cada uno. Una entropía cruzada discreta se encarga de las secuencias y un objetivo de regresión de las estructuras.

Después, una capa de autoatención global establece los vínculos entre secuencia y estructura en un contexto común. Las dos representaciones procesadas por separado se encuentran en una única capa de atención.

Resultados y límites

Los investigadores entrenaron el modelo con más de 2 millones de pares secuencia-estructura. Se informan resultados competitivos en pruebas de codiseño y de generación incondicional.

Conviene ser prudente: es un modelo de investigación. No equivale a un fármaco nuevo ni a una proteína validada en laboratorio. Un diseño que puntúa bien en el ordenador todavía tiene que plegarse y funcionar, y esa es otra fase de validación.

Qué hace Apple aquí

Ver a Apple del lado de la biología sorprende a primera vista. El brazo de investigación en aprendizaje automático de la empresa lleva tiempo publicando trabajos independientes de su línea de producto, la mayoría como artículos abiertos.

La aportación aquí no es un producto sino una afirmación de simplificación: mostrar que el montaje asentado en dos etapas no hace falta. Si la afirmación se sostiene, la ganancia no está solo en velocidad sino en la información que se perdía en la etapa intermedia.