Articulo de referencia

Sistema simplificado de entrada de línea molecular

Algoritmo de generación SMILES para ciprofloxacina : romper ciclos y luego escribir como ramificaciones a partir de una estructura principal. El Sistema Simplificado de Entrada ...

Algoritmo de generación SMILES para ciprofloxacina : romper ciclos y luego escribir como ramificaciones a partir de una estructura principal.

El Sistema Simplificado de Entrada Lineal Molecular ( SMILES ) es una especificación en forma de notación lineal para describir la estructura de especies químicas mediante cadenas ASCII cortas . La mayoría de los editores de moléculas pueden importar cadenas SMILES para convertirlas de nuevo en dibujos bidimensionales o modelos tridimensionales de las moléculas.

La especificación SMILES original se inició en la década de 1980. Desde entonces, se ha modificado y ampliado. En 2007, la comunidad de química de código abierto desarrolló un estándar abierto llamado OpenSMILES para armonizar los diferentes dialectos. [ 1 ]

Historia

La especificación original de SMILES fue iniciada por David Weininger en el Laboratorio de la División de Ecología del Medio Continente de la USEPA en Duluth, Minnesota , en la década de 1980. [ 2 ] [ 3 ] [ 4 ] [ 5 ] Se reconoció la contribución en el desarrollo inicial de "Gilman Veith y Rose Russo (USEPA) y Albert Leo y Corwin Hansch ( Pomona College ) por su apoyo al trabajo, y Arthur Weininger (Pomona; Daylight CIS) y Jeremy Scofield (Cedar River Software, Renton, WA) por su asistencia en la programación del sistema". [ 6 ] La Agencia de Protección Ambiental financió el proyecto inicial para desarrollar SMILES. [ 7 ] [ 8 ]

Posteriormente, otros lo modificaron y ampliaron, sobre todo Daylight Chemical Information Systems . En 2007, la comunidad de química de código abierto Blue Obelisk desarrolló un estándar abierto llamado "OpenSMILES" . Otras notaciones lineales incluyen la notación lineal de Wiswesser (WLN), ROSDAL y SLN (Tripos Inc).

En julio de 2006, la IUPAC introdujo el InChI como estándar para la representación de fórmulas. Generalmente se considera que SMILES tiene la ventaja de ser más legible para los humanos que InChI; además, cuenta con una amplia base de soporte de software y un extenso respaldo teórico (como la teoría de grafos ).

Terminología

El término SMILES se refiere a una notación lineal para codificar estructuras moleculares, y las instancias específicas deben denominarse estrictamente cadenas SMILES. Sin embargo, el término SMILES también se usa comúnmente para referirse tanto a una sola cadena SMILES como a varias; el significado exacto suele ser evidente por el contexto. Los términos "canónico" e "isomérico" pueden generar cierta confusión al aplicarse a SMILES. Estos términos describen diferentes atributos de las cadenas SMILES y no son mutuamente excluyentes.

Normalmente, se pueden escribir varias cadenas SMILES igualmente válidas para una molécula. Por ejemplo, CCO, OCCy C(O)Ctodas especifican la estructura del etanol . Se han desarrollado algoritmos para generar la misma cadena SMILES para una molécula dada; de las muchas cadenas posibles, estos algoritmos eligen solo una de ellas. Esta SMILES es única para cada estructura, aunque depende del algoritmo de canonización utilizado para generarla, y se denomina SMILES canónica. Estos algoritmos primero convierten la SMILES a una representación interna de la estructura molecular; luego un algoritmo examina esa estructura y produce una cadena SMILES única. Se han desarrollado varios algoritmos para generar SMILES canónicas, incluidos los de Daylight Chemical Information Systems, OpenEye Scientific Software , MEDIT , Chemical Computing Group , MolSoft LLC y Chemistry Development Kit . Una aplicación común de SMILES canónica es la indexación y garantía de la unicidad de las moléculas en una base de datos .

El artículo original que describía el algoritmo CANGEN [ 3 ] afirmaba generar cadenas SMILES únicas para grafos que representaban moléculas, pero el algoritmo falla en varios casos sencillos (por ejemplo, cuneano , 1,2-diciclopropiletano) y no puede considerarse un método correcto para representar un grafo de forma canónica. [ 9 ] Actualmente no existe una comparación sistemática entre software comercial para comprobar si existen tales fallos en esos paquetes.

La notación SMILES permite especificar la configuración en centros tetraédricos y la geometría de los enlaces dobles. Estas son características estructurales que no pueden especificarse únicamente mediante la conectividad; por lo tanto, las notaciones SMILES que codifican esta información se denominan SMILES isoméricas. Una característica destacada de estas reglas es que permiten una especificación parcial rigurosa de la quiralidad. El término SMILES isoméricas también se aplica a las notaciones SMILES en las que se especifican isómeros .

Definición basada en grafos

En términos de un procedimiento computacional basado en grafos, SMILES es una cadena obtenida al imprimir los nodos de símbolos encontrados en un recorrido en profundidad de un grafo químico . El grafo químico se recorta primero para eliminar los átomos de hidrógeno y se rompen los ciclos para convertirlo en un árbol de expansión . Donde se han roto los ciclos, se incluyen etiquetas de sufijo numérico para indicar los nodos conectados. Los paréntesis se utilizan para indicar los puntos de ramificación en el árbol.

La forma SMILES resultante depende de las elecciones:

  • de los vínculos elegidos para romper ciclos,
  • del átomo inicial utilizado para el recorrido en profundidad, y
  • del orden en que se enumeran las ramas cuando se encuentran.

Definición de SMILES como cadenas de un lenguaje libre de contexto

Desde la perspectiva de la teoría del lenguaje formal, SMILES es una palabra. Un SMILES se puede analizar con un analizador sintáctico libre de contexto. El uso de esta representación se ha centrado en la predicción de propiedades bioquímicas (incluidas la toxicidad y la biodegradabilidad ) basándose en el principio fundamental de la quimioinformática de que las moléculas similares tienen propiedades similares. Los modelos predictivos implementaron un enfoque de reconocimiento de patrones sintácticos (que implicaba definir una distancia molecular) [ 10 ] , así como un esquema más robusto basado en el reconocimiento de patrones estadísticos [ 11 ] .

Descripción

Átomos

Los átomos se representan mediante la abreviatura estándar de los elementos químicos , entre corchetes, como por ejemplo [Au]para el oro . Los corchetes pueden omitirse en el caso común de átomos que:

  1. están en el " subconjunto orgánico " de B , C , N , O , P , S , F , Cl , Br o I , y
  2. no tienen ningún cargo formal y
  3. tienen el número de hidrógenos unidos implícito por el modelo de valencia SMILES (típicamente su valencia normal, pero para N y P es 3 o 5, y para S es 2, 4 o 6), y
  4. son los isótopos normales y
  5. no son centros quirales .

Todos los demás elementos deben ir entre corchetes y mostrarse explícitamente las cargas y los hidrógenos. Por ejemplo, la representación SMILES del agua puede escribirse como Oo [OH2]. El hidrógeno también puede escribirse como un átomo separado; el agua también puede escribirse como [H]O[H].

Cuando se usan corchetes, Hse agrega el símbolo si el átomo entre corchetes está unido a uno o más hidrógenos, seguido del número de átomos de hidrógeno si es mayor que 1, luego por el signo +para una carga positiva o por -para una carga negativa. Por ejemplo, [NH4+]para el amonio ( NH + 4 ). Si hay más de una carga, normalmente se escribe como dígito; sin embargo, también es posible repetir el signo tantas veces como cargas tenga el ion: se puede escribir o [Ti+4]para [Ti++++]el titanio (IV) Ti 4+ . Así, el anión hidróxido ( OH ) se representa por , el catión hidronio ( H 3 O + ) es y el catión cobalto (III) ( Co 3+ ) es o .[OH-][OH3+][Co+3][Co+++]

Cautiverio

Un bono se representa utilizando uno de los símbolos .. - = # $ : / \

Se asume que los enlaces entre átomos alifáticos son simples a menos que se especifique lo contrario y se deducen por adyacencia en la cadena SMILES. Aunque los enlaces simples pueden escribirse como -, esto generalmente se omite. Por ejemplo, el SMILES para el etanol puede escribirse como C-C-O, CC-Oo C-CO, pero generalmente se escribe CCO.

Los enlaces dobles, triples y cuádruples están representados por los símbolos =, #, y $respectivamente, como se ilustra en las SMILES O=C=O( dióxido de carbono CO 2 ), C#N( cianuro de hidrógeno HCN) y [Ga+]$[As-]( arseniuro de galio ).

Otro tipo de enlace es el "no enlace", indicado con ., para señalar que dos partes no están unidas entre sí. Por ejemplo, el cloruro de sodio acuoso se puede escribir como [Na+].[Cl-]para mostrar la disociación.

Un enlace aromático "uno y medio" puede indicarse con :; véase §  Aromaticidad más abajo.

Los enlaces simples adyacentes a los enlaces dobles pueden representarse utilizando /o \para indicar la configuración estereoquímica; véase la sección  Estereoquímica a continuación.

Anillos

Las estructuras de anillo se escriben dividiendo cada anillo en un punto arbitrario (aunque algunas opciones darán como resultado un SMILES más legible que otras) para crear una estructura acíclica y añadiendo etiquetas numéricas de cierre de anillo para mostrar la conectividad entre átomos no adyacentes.

Por ejemplo, el ciclohexano y el ( p- )dioxano se pueden escribir como C1CCCCC1y O1CCOCC1respectivamente. Para un segundo anillo, la etiqueta será 2. Por ejemplo, la decalina (decahidronaftaleno) se puede escribir como C1CCCC2C1CCCC2.

SMILES no requiere que los números de anillo se utilicen en un orden particular y permite el número de anillo cero, aunque esto se usa raramente. También se permite reutilizar los números de anillo después de que el primer anillo se haya cerrado, aunque esto generalmente dificulta la lectura de las fórmulas. Por ejemplo, el biciclohexilo generalmente se escribe como C1CCCCC1C2CCCCC2, pero también puede escribirse como C0CCCCC0C0CCCCC0.

Varios dígitos después de un solo átomo indican múltiples enlaces de cierre de anillo. Por ejemplo, una notación SMILES alternativa para la decalina es C1CCCC2CCCCC12, donde el carbono final participa en ambos enlaces de cierre de anillo 1 y 2. Si se requieren números de anillo de dos dígitos, la etiqueta va precedida de %, por lo que C%12es un único enlace de cierre de anillo del anillo 12.

Uno o ambos dígitos pueden ir precedidos por un tipo de enlace para indicar el tipo de enlace de cierre de anillo. Por ejemplo, el ciclopropeno se suele escribir C1=CC1, pero si se elige el doble enlace como enlace de cierre de anillo, puede escribirse como C=1CC1, C1CC=1, o C=1CC=1. (Se prefiere la primera forma). C=1CC-1es ilegal, ya que especifica explícitamente tipos conflictivos para el enlace de cierre de anillo.

Los enlaces de cierre de anillo no pueden usarse para denotar enlaces múltiples. Por ejemplo, C1C1no es una alternativa válida a C=Cpara el etileno . Sin embargo, pueden usarse con no enlaces; C1.C2.C12es una forma alternativa peculiar pero legal de escribir propano , que se escribe más comúnmente CCC.

Elegir un punto de ruptura del anillo adyacente a grupos unidos puede conducir a una forma SMILES más simple al evitar ramificaciones. Por ejemplo, el ciclohexano-1,2-diol se escribe de forma más sencilla como OC1CCCCC1O; elegir una ubicación diferente para la ruptura del anillo produce una estructura ramificada que requiere paréntesis para escribir.

Aromaticidad

Los anillos aromáticos , como el benceno, pueden escribirse de tres formas:

  1. En forma de Kekulé con enlaces simples y dobles alternados, por ejemplo C1=CC=CC=C1,
  2. Utilizando el símbolo de enlace aromático :, por ejemplo C1:C:C:C:C:C1, o
  3. Lo más común es escribir los átomos constituyentes B, C, N, O, P y S en minúsculas b, crespectivamente .nops

En este último caso, se asume (si no se muestra explícitamente) que los enlaces entre dos átomos aromáticos son enlaces aromáticos. Por lo tanto, el benceno , la piridina y el furano pueden representarse respectivamente mediante las notaciones SMILES c1ccccc1, n1ccccc1y o1cccc1.

El nitrógeno aromático unido al hidrógeno, como se encuentra en el pirrol, debe representarse como [nH]; por lo tanto, el imidazol se escribe en notación SMILES como n1c[nH]cc1.

Cuando los átomos aromáticos están unidos mediante enlaces simples, como en el bifenilo , debe indicarse explícitamente un enlace simple: c1ccccc1-c2ccccc2. Este es uno de los pocos casos en los que -se requiere el símbolo de enlace simple. (De hecho, la mayoría de los programas SMILES pueden inferir correctamente que el enlace entre los dos anillos no puede ser aromático y, por lo tanto, aceptan la forma no estándar c1ccccc1c2ccccc2).

Los algoritmos Daylight y OpenEye para generar SMILES canónicos difieren en su tratamiento de la aromaticidad.

Visualización de 3-cianoanisol como COc(c1)cccc1C#N.

Derivación

Las ramificaciones se describen con paréntesis, como en CCC(=O)Oel caso del ácido propiónico y FC(F)Fdel fluoroformo . El primer átomo dentro de los paréntesis y el primer átomo después del grupo entre paréntesis están unidos al mismo átomo del punto de ramificación. El símbolo de enlace debe aparecer dentro de los paréntesis; fuera (por ejemplo, CCC=(O)O) no es válido.

Los anillos sustituidos pueden representarse con el punto de ramificación en el anillo, como se ilustra en las figuras SMILES COc(c1)cccc1C#N( véase la figura ) y COc(cc1)ccc1C#N( véase la figura ), que codifican los isómeros 3 y 4 del cianoanisol. Escribir las figuras SMILES de los anillos sustituidos de esta manera puede facilitar su lectura.

Las ramas pueden escribirse en cualquier orden. Por ejemplo, el bromoclorodifluorometano puede escribirse como FC(Br)(Cl)F, BrC(F)(F)Cl, C(F)(Cl)(F)Br, o similar. Generalmente, una forma SMILES es más fácil de leer si la rama más simple va primero, siendo la parte final, sin paréntesis, la más compleja. Las únicas excepciones a tales reordenamientos son:

  • Si se reutilizan los números de anillo, se emparejan según su orden de aparición en la cadena SMILES. Es posible que se requieran algunos ajustes para mantener el emparejamiento correcto.
  • Si se especifica la estereoquímica, deben realizarse ajustes; véase el apartado  Estereoquímica a continuación.

La única forma de ramificación que no requiere paréntesis son los enlaces de cierre de anillo: el fragmento SMILES C1Nes equivalente a C(1)N, ambos denotando un enlace entre Cy N. Elegir enlaces de cierre de anillo adyacentes a los puntos de ramificación puede reducir la cantidad de paréntesis necesarios. Por ejemplo, el tolueno normalmente se escribe como Cc1ccccc1o c1ccccc1C, evitando los paréntesis necesarios si se escribe como c1cc(C)ccc1o c1cc(ccc1)C.

Estereoquímica

trans -1,2-difluoroetileno

SMILES permite, pero no exige, la especificación de estereoisómeros .

La configuración alrededor de los enlaces dobles se especifica mediante los caracteres /y \para mostrar los enlaces simples direccionales adyacentes a un enlace doble. Por ejemplo, F/C=C/F( véase la representación ) es una representación del trans - 1,2-difluoroetileno , en la que los átomos de flúor están en lados opuestos del enlace doble (como se muestra en la figura), mientras que F/C=C\F( véase la representación ) es una posible representación del cis -1,2-difluoroetileno, en la que los flúor están en el mismo lado del enlace doble.

Los símbolos de dirección de enlace siempre aparecen en grupos de al menos dos, de los cuales el primero es arbitrario. Es decir, F\C=C\Fes lo mismo que F/C=C/F. Cuando hay enlaces simples y dobles alternados, los grupos son mayores de dos, y los símbolos direccionales centrales están adyacentes a dos enlaces dobles. Por ejemplo, la forma común del (2,4)-hexadieno se escribe C/C=C/C=C/C.

Betacaroteno , con los once enlaces dobles resaltados.

Como ejemplo más complejo, el betacaroteno tiene una cadena principal muy larga de enlaces simples y dobles alternados, que se puede escribir como CC1CCC/C(C)=C1/C=C/C(C)=C/C=C/C(C)=C/C=C/C=C(C)/C=C/C=C(C)/C=C/C2=C(C)/CCCC2(C)C.

La configuración en el carbono tetraédrico se especifica mediante @o @@. Consideremos los cuatro enlaces en el orden en que aparecen, de izquierda a derecha, en la notación SMILES. Desde la perspectiva del primer enlace, mirando hacia el carbono central, los otros tres son en sentido horario o antihorario. Estos casos se indican con @@y @, respectivamente (porque el @símbolo en sí es una espiral en sentido antihorario).

L -alanina

Por ejemplo, consideremos el aminoácido alanina . Una de sus formas SMILES es NC(C)C(=O)O, escrita más completamente como N[CH](C)C(=O)O. La L -alanina , el enantiómero más común , se escribe como N[C@@H](C)C(=O)O( véase la representación ). Desde el enlace nitrógeno-carbono, los grupos hidrógeno ( H), metilo ( C) y carboxilato ( C(=O)O) aparecen en sentido horario. La D -alanina se puede escribir como N[C@H](C)C(=O)O( véase la representación ).

Aunque el orden en que se especifican las ramas en SMILES normalmente no es importante, en este caso sí lo es; intercambiar dos grupos cualesquiera requiere invertir el indicador de quiralidad. Si las ramas se invierten de modo que la alanina se escribe como NC(C(=O)O)C, entonces la configuración también se invierte; la L -alanina se escribe como N[C@H](C(=O)O)C( véase la representación ). Otras formas de escribirla incluyen C[C@H](N)C(=O)O, OC(=O)[C@@H](N)Cy OC(=O)[C@H](C)N.

Normalmente, el primero de los cuatro enlaces aparece a la izquierda del átomo de carbono, pero si el SMILES se escribe comenzando con el carbono quiral, como C(C)(N)C(=O)O, entonces los cuatro están a la derecha, pero el primero en aparecer (el [CH]enlace en este caso) se usa como referencia para ordenar los tres siguientes: La L -alanina también se puede escribir [C@@H](C)(N)C(=O)O.

La especificación SMILES incluye elaboraciones sobre el @símbolo para indicar la estereoquímica alrededor de centros quirales más complejos, como la geometría molecular bipiramidal trigonal .

isótopos

Los isótopos se especifican con un número igual a la masa isotópica entera que precede al símbolo atómico. El benceno, en el que un átomo es carbono-14, se escribe como [14cH]1ccccc1y el deuterocloroformo como [2H]C(Cl)(Cl)Cl.

Ejemplos

Para ilustrar una molécula con más de 9 anillos, considérese la cefalostatina - 1 , [ 13 ] una pirazina esteroidea de 13 anillos con la fórmula empírica C54H74N2O10 aislada del hemicordado del Océano Índico Cephalodiscus gilchristi :

Estructura molecular de la cefalostatina-1

Comenzando con el grupo metilo más a la izquierda en la figura:

CC(C)(O1)C[C@@H](O)[C@@]1(O2)[C@@H](C)[C@@H]3CC=C4[C@]3(C2)C(=O)C[C@H]5[C@H]4CC[C@@H](C6)[C@]5(C)Cc(n7)c6nc(C[C@@]89(C))c7C[C@@H]8CC[C@@H]%10[C@@H]9C[C@@H](O)[C@@]%11(C)C%10=C[C@H](O%12)[C@]%11(O)[C@H](C)[C@]%12(O%13)[C@H](O)C[C@@]%13(C)CO

%aparece delante del índice de etiquetas de cierre de anillo por encima del 9; véase §  Anillos más arriba.

Otros ejemplos de SONRISAS

La notación SMILES se describe detalladamente en el manual de teoría SMILES proporcionado por Daylight Chemical Information Systems, donde se presentan varios ejemplos ilustrativos. La herramienta de representación gráfica de Daylight permite a los usuarios comprobar sus propios ejemplos de SMILES y constituye una valiosa herramienta didáctica.

La especificación OpenSMILES también incluye un gran número de ejemplos con comentarios sobre su aceptación por diferentes implementaciones. [ 1 ]

Extensiones

SMARTS es una notación lineal para la especificación de patrones subestructurales en moléculas. Si bien utiliza muchos de los mismos símbolos que SMILES, también permite la especificación de átomos y enlaces comodín , que pueden usarse para definir consultas subestructurales para la búsqueda en bases de datos químicas . Una idea errónea común es que la búsqueda subestructural basada en SMARTS implica la comparación de cadenas SMILES y SMARTS. De hecho, tanto las cadenas SMILES como las SMARTS se convierten primero en representaciones gráficas internas que se buscan para detectar isomorfismo de subgrafos .

SMIRKS, un superconjunto de "reaction SMILES" y un subconjunto de "reaction SMARTS", es una notación lineal para especificar transformaciones de reacción. La sintaxis general para las extensiones de reacción es (sin espacios), donde cualquiera de los campos puede dejarse en blanco o rellenarse con múltiples moléculas delimitadas por un punto ( ), y otras descripciones que dependen del lenguaje base. Los átomos pueden identificarse adicionalmente con un número (p. ej . ) para el mapeo, [ 14 ] por ejemplo en la esterificación . [ 15 ] Existen varias herramientas informáticas para imputar información de mapeo de átomos basada en reaction SMILES. [ 16 ]REACTANT>AGENT>PRODUCT.[C:1]C[C:2](=[O:1])[OH:1]>>C[C:2](=[O:1])OCC

SMILES corresponde a estructuras moleculares discretas. Sin embargo, muchos materiales son macromoléculas, que son demasiado grandes (y a menudo estocásticas) para generar SMILES de forma conveniente. BigSMILES es una extensión de SMILES que busca proporcionar un sistema de representación eficiente para macromoléculas. Introduce una nueva notación de llaves para enumerar las unidades repetitivas de polímeros. Por ejemplo, el poli(etileno-acetato de vinilo) se escribe {CC,CC(OC(=O)C)}. [ 17 ]

Conversión

Las representaciones SMILES pueden convertirse de nuevo a bidimensionales mediante algoritmos de generación de diagramas de estructura (SDG). [ 18 ] Esta conversión a veces resulta ambigua. La conversión a representación tridimensional se logra mediante métodos de minimización de energía. Existen numerosas utilidades de conversión descargables y en línea.

Véase también

Referencias

  1. 1 2 "Especificación OpenSMILES versión 1.0" . opensmiles.org . 15 de mayo de 2016.
  2. Weininger D (febrero de 1988). "SMILES, un lenguaje químico y un sistema de información. 1. Introducción a la metodología y las reglas de codificación". Journal of Chemical Information and Computer Sciences . 28 (1): 31– 6. doi : 10.1021/ci00057a005 .
  3. 1 2 Weininger D, Weininger A, Weininger JL (mayo de 1989). "SMILES. 2. Algoritmo para la generación de notación SMILES única". Journal of Chemical Information and Modeling . 29 (2): 97– 101. doi : 10.1021/ci00062a008 .
  4. Weininger D (agosto de 1990). "SMILES. 3. DEPICT. Representación gráfica de estructuras químicas". Journal of Chemical Information and Modeling . 30 (3): 237– 43. doi : 10.1021/ci00067a005 .
  5. Swanson RP (2004). "La entrada de la informática en la química combinatoria" (PDF) . En Rayward WB, Bowden ME (eds.). Historia y legado de los sistemas de información científica y tecnológica: Actas de la Conferencia de 2002 de la Sociedad Estadounidense de Ciencia y Tecnología de la Información y la Fundación del Patrimonio Químico . Medford, NJ: Information Today . pág. 205. ISBN  978-1-57387-229-4.
  6. Weininger D (1998). "Agradecimientos en la página de sonrisas, etc. del tutorial de luz natural" . Recuperado el 24 de junio de 2013 .
  7. Anderson E, Veith GD, Weininger D (1987). SMILES: Un intérprete computarizado y de notación lineal para estructuras químicas (PDF) . Duluth, MN: US EPA , Environmental Research Laboratory-Duluth. Informe n.° EPA/600/M-87/021.
  8. "Tutorial de SMILES: ¿Qué es SMILES?" . Agencia de Protección Ambiental de EE. UU . . Archivado del original el 28 de marzo de 2008 . Consultado el 23 de septiembre de 2012 .
  9. Neglur G, Grossman RL, Liu B (2005). "Asignación de claves únicas a compuestos químicos para la integración de datos: algunos contraejemplos interesantes" . En Ludäscher B (ed.). Integración de datos en las ciencias de la vida . Lecture Notes in Computer Science. Vol. 3615. Berlín: Springer. pp. 145–157 . doi : 10.1007/11530084_13 . ISBN   978-3-540-27967-9. Consultado el 12 de febrero de 2013 .
  10. Sidorova J, Anisimova M (agosto de 2014). "Reconocimiento de patrones estructurales inspirado en PLN en aplicaciones químicas". Pattern Recognition Letters . 45 : 11–16 . Bibcode : 2014PaReL..45...11S . doi : 10.1016/j.patrec.2014.02.012 .
  11. Sidorova J, Garcia J (noviembre de 2015). "Uniendo métodos sintácticos con métodos estadísticos: Clasificación con características segmentadas automáticamente a partir de secuencias". Pattern Recognition . 48 (11): 3749– 3756. Bibcode : 2015PatRe..48.3749S . doi : 10.1016/j.patcog.2015.05.001 . hdl : 10016/33552 .
  12. Byers JA, Birgersson G, Löfqvist J, Appelgren M, Bergström G (marzo de 1990). "Aislamiento de sinergistas de feromonas del escarabajo de la corteza, Pityogenes chalcographus, a partir de olores complejos de insectos y plantas mediante fraccionamiento y bioensayo de combinación sustractiva". Journal of Chemical Ecology . 16 (3): 861– 876. Bibcode : 1990JCEco..16..861B . doi : 10.1007/BF01016496 . PMID 24263601. S2CID 226090 .  
  13. "CID 183413" . PubChem . Consultado el 12 de mayo de 2012 .
  14. "Tutorial SMIRKS" . Daylight Chemical Information Systems, Inc. Consultado el 29 de octubre de 2018 .
  15. "Reacción SONRISAS y SONRISAS" . Daylight Chemical Information Systems, Inc. Recuperado el 29 de octubre de 2018 .
  16. Lin TS, Coley CW, Mochigase H, Beech HK, Wang W, Wang Z, et al. (septiembre de 2019). "BigSMILES: una notación lineal basada en la estructura para describir macromoléculas" . ACS Central Science . 5 (9): 1523– 1531. doi : 10.1021/acscentsci.9b00476 . PMC 6764162. PMID 31572779 .   
  17. Helson HE (1999). "Generación de diagramas estructurales". En Lipkowitz KB, Boyd DB (eds.). Reviews in Computational Chemistry . Vol. 13. Nueva York: Wiley-VCH. pp. 313–398 . doi : 10.1002/9780470125908.ch6 . ISBN   978-0-470-12590-8.