Mostrando entradas con la etiqueta Siri. Mostrar todas las entradas
Mostrando entradas con la etiqueta Siri. Mostrar todas las entradas

lunes, 1 de octubre de 2012

Sherpa: un asistente de voz español para Android quiere retar a Siri

 
Tras recibir una indicación de voz, Sherpa conecta con el sitio web de música Goear para reproducir una canción sin necesidad de descargarla.

Sherpa, un asistente virtual compatible con el 95 por ciento de los teléfonos inteligentes Android, destaca por su avanzada tecnología de procesamiento del lenguaje natural.

No han pasado ni quince días desde que Apple anunciara que gracias a la actualización de su sistema operativo móvil ya podíamos hablar en español con Siri, su asistente virtual para teléfonos inteligentes, y ya le ha salido un competidor que asegura que entiende mucho mejor que él la lengua de Cervantes.
Se trata de Sherpa, una aplicación gratuita para móviles Android cuya versión beta puede descargarse desde hoy en Google Play, el antiguo Android Market. Tras ocho años de intenso trabajo, una start-up española liderada por el ingeniero Xabier Uribe-Etxebarria –uno de los 10 ganadores de la primera edición de los premios TR35 Spain- acaba de lanzarse a la competida arena de los asistentes virtuales.
Sherpa funciona en todos los modelos de móvil que tengan instalado el sistema operativo de Android en una versión igual o superior a la 2.2 (conocida como Froyo), es decir, en más del 95 por ciento de los dispositivos activos que utilizan este sistema, según estimaciones de la propia Android.
Además de dominar las funciones habituales de estos ‘ayudantes’, como ofrecer al usuario información del tiempo, facilitarle las búsquedas en Internet, o gestionar la agenda, Sherpa ofrece algunas más, que le son exclusivas. Entre ellas destaca la posibilidad de realizar transacciones a través de PayPal –por ejemplo, ordenando y confirmando una transferencia a un contacto guardado en el teléfono mediante la voz- y la de buscar billetes de avión a través de Lastminute.com aunque, en este caso, habría que hacer la compra desde el sitio web de esta página de ofertas.
Sherpa también permite al usuario publicar en su nombre en Facebook y Twitter y decirle al móvil que reproduzca una canción cualquiera, que pasa a sonar inmediatamente gracias a un acuerdo alcanzado con Goear para ofrecer música sin necesidad de descarga.
Esta nueva aplicación recopila la información de acceso de varias cuentas del usuario -como las de Facebook, PayPal y Twitter- en una base de datos situada en  su sistema de gestión. Estos datos están en la nube, por lo que podría acceder con su contraseña y usuario desde cualquier dispositivo. Del mismo modo, las búsquedas que el programa realiza extraen la información de servidores en línea, así que solo funciona cuando está conectado a Internet (a través de wifi o de una red 3G).
Por ahora no hay versión de Sherpa para tabletas aunque la empresa está trabajando en su desarrollo con la intención de incorporar esta posibilidad en la siguiente versión. “Por el momento estamos adaptándola para que se vea decentemente en ellas”, reconoce Uribe-Extebarria, que dirige un equipo de 12 personas.
Menos problemas habría con la incorporación de nuevos idiomas a Sherpa, ya que al disponer de un lenguaje intermedio de conceptos, no de palabras concretas, puede ser multilingüe. “Pensamos sacarla para varios idiomas. No hace falta hacer un desarrollo por cada uno”, asegura el ingeniero.  
Y es que aunque resulta gracioso escuchar las respuestas que ofrece su voz mecánica a preguntas diversas, Uribe-Etxebarria afirma que su objetivo no es que se utilice como un juego, sino “explotar su lado útil”.
Sherpa es rápido resolviendo tareas sencillas, como subir el volumen del terminal, dar el resultado del último partido de fútbol, buscar la previsión del tiempo o los restaurantes japoneses de la zona. Pero según su creador, si esta aplicación es “muy superior a lo que hemos podido ver hasta ahora en Android e incluso en otras plataformas" es debido, sobre todo, a su sistema de procesamiento de lenguaje natural y su capacidad de establecer un verdadero diálogo con el usuario.
Su tecnología de comprensión y gestión del diálogo está patentada a nivel internacional, y tal y como explica Deborah Dahl, responsable del diseño del sistema de comprensión del lenguaje Unisys de la Agencia de Investigación de Proyectos Avanzados de Defensa de Estados Unidos (DARPA), y autora de un informe en el que analiza el sistema de Sherpa, hay varias razones que lo diferencian.
La primera sería su “profundo y exhaustivo” conocimiento de los idiomas que analiza. El núcleo del sistema de Sherpa incluye 250.000 conceptos y 5.000 reglas sintácticas y semánticas, junto a los diccionarios necesarios para dar soporte a los conceptos. "Este conocimiento general ha sido testeado mucho más concienzudamente que el que pueda haber sido creado solo para una aplicación en concreto y, por tanto, es mucho más fiable”, explica Dahl.
Las otras dos características que destaca la experta en su informe -fechado en agosto de este año- son “el énfasis en las representaciones conceptuales derivadas del análisis, que son independientes del idioma en sí, y su proceso de análisis lingüístico, que integra cinco niveles”.
Los cinco estratos de procesado a los que se refiere son los que permiten eliminar ambigüedades y acertar sobre la intención real del usuario, independientemente del idioma que éste hable. El proceso comienza con un reconocimiento automático de voz que convierte ésta en texto. A continuación Sherpa lo analiza para extraer su significado realizando los cinco análisis: morfológico, sintáctico, semántico, pragmático y funcional. Todo ello se lleva a cabo en el módulo de procesamiento de lenguaje natural, donde se extraen los conceptos de lo que el usuario ha dicho. "Trabajamos los significados, no las palabras", recuerda Uribe-Etxebarria.
Un vez que Sherpa conoce los conceptos entra en juego el sistema de diálogo, que pregunta al usuario por los datos que le faltan para poder realizar una acción por él. Cuando dispone de toda la información que necesita -que es diferente para cada ‘tarea’- conecta con las Interfaces de Programación de Aplicaciones (API, por sus siglas en inglés) de diferentes servicios externos, como Facebook o Twitter, donde realiza la acción y obtiene la confirmación de que se ha hecho correctamente.
Todos estos procesos pasan también por el sistema de gestión, que es el que identifica, por ejemplo, con qué cuenta quiere el usuario hacer un pago, o se asegura de responderle a un saludo mencionando su nombre su pila.
Aunque desde Sherpa dicen que la competencia con Apple no es directa, ambos han entrado en el mismo mercado, el de las búsquedas a través de la voz, en el que según la consultora Gartner “los ingresos por publicidad en el móvil aumentarán hasta superar el 40 por ciento en 2015”.
Además, desde el punto de vista tecnológico, la comparación con el asistente virtual de Apple es inevitable. "Siri no establece un diálogo real", explica Dahl en su informe. "El usuario hace una petición y Siri ofrece una respuesta, pero raramente te entiende si repreguntas sobre la respuesta anterior", explica la investigadora.
Aunque Sherpa sale después de que Apple anunciara su versión de Siri en español, Uribe-Extebarria no cree que esto vaya a perjudicarles, ya que además de estar orientados a plataformas diferentes considera que ellos son “tecnológicamente superiores”.
Como ejemplo de ello destaca su modulo de adquisición de conocimiento, que Sherpa utiliza para resolver preguntas como: “¿Dónde nació Obama?”. Siri utiliza para este tipo de consultas el motor de búsqueda Wolfram Alpha, que solo tiene versión en inglés. Sherpa, en su lugar, utiliza otras fuentes diversas, como Wikipedia o el proyecto de Web semántica DBpedia, lo que le permite ser mucho más efectivo. “Como no existía Wolfram Alpha en español, Apple le quitó a Siri en español esas funcionalidades”, comenta el emprendedor.
Apple no ha respondido a MIT Technology Review en español sobre estos aspectos antes de la fecha de publicación de este artículo.
Por su parte, la compañía de software de reconocimiento de voz Nuance anunciaba esta misma semana que estaba trabajando con varios fabricantes de chips para que los usuarios pudieran darle órdenes de voz a su smartphone incluso cuando esté en modo 'sueño', gracias a una escucha constante. A Uribe-Etxebarria se gusta está aplicación pero considera que aún no ha sido suficientemente probada. "Hay que mirar dos cosas: que funcione correctamente y el rendimiento de la batería", explica. "Nosotros estamos buscando otras opciones para lograr el mismo efecto".
Además de disponer de un asistente virtual propio, Dragon go!, que a diferencia de Siri funciona también para dispositivos iOS anteriores al iPhone 4S, Nuance compró en 2011 al que será otro de los competidores de Sherpa, Vlingo, cuyo asistente de voz tiene versiones para Symbian, Android, iPhone y BlackBerry. "Es un competidor muy serio, con más recursos de nosotros", reconoce Uribe. "Tenemos una tecnología superior pero tenemos que hacer bien la ejecución", añade.
En cuanto al modelo de negocio, Sherpa ha llegado a acuerdos con algunas empresas para recibir compensaciones por enviar tráfico a sus webs y están valorando también la inserción de anuncios, pero Uribe-Extebarria asegura que no es algo que les preocupe en este momento. “Queremos que la gente lo use”, insiste. ”Si tenemos algo útil, luego es fácil de monetizar”.
El emprendedor se muestra optimista con el lanzamiento pero puntualiza que solo hemos visto una mínima parte de lo que esta tecnología puede aportar: “un 0,001 por ciento”, aventura. Su visión para Sherpa es seguir perfeccionándola hasta exprimirla mucho más. ”Sabemos que estamos lejos, pero estamos más cerca que otros”, afirma.
En este sentido Sherpa es un reflejo de la ambición de su creador. Si le preguntas “¿Me quieres?” su respuesta es toda una declaración de intenciones: “¿Qué crees, que me voy a rendir a tus pies como un Siri cualquiera?”
Copyright Technology Review 2012.

lunes, 30 de enero de 2012

Evi: Un nuevo ayudante virtual le planta cara a Siri

Preguntas y respuestas: La aplicación de teléfono inteligente Evi utiliza datos semánticos de su plataforma, así como información externa para responder a preguntas. Puedes hacer preguntas en voz alta o tecleándolas. 
Fuente: True Knowledge


La aplicación Evi utiliza datos semánticos para ofrecer una gama de respuestas más amplia.

El mercado de los asistentes para teléfonos inteligentes se está animando: a Siri, el ayudante virtual de Apple para el iPhone, se le acaba de unir un compañero y enemigo, Evi.
La aplicación Evi, creada por True Knowledge, una start-up de tecnología semántica con sede en Cambridge, Reino Unido, es capaz de responder a preguntas en voz alta como si estuviera manteniendo una conversación, tal y como lo hace Siri. Pero a diferencia de esta última, que solo está disponible con el último modelo de iPhone, Evi puede descargarse como aplicación para este dispositivo y para los teléfonos con el software Android de Google.
Siri y otros asistentes personales tienen, a día de hoy, bastantes limitaciones. A medida que se vuelvan más populares, tanto las empresas establecidas como las start-upstendrán que ampliar la gama de tareas que puedan realizar. True Knowledge espera que la base de datos semántica que ha construido a lo largo de los últimos años pueda ofrecer esta ventaja.
La disponibilidad y promesa de Evi como aplicación de inteligencia artificial, junto a su reducido precio (99 centavos de dólar para el iPhone (0,75 euros) y gratuita en los teléfonos Android), ha hecho que su popularidad subiera por las nubes tras su lanzamiento el pasado lunes, y que aquellos que la descargaron tuvieran problemas para poder usarla. Evi no es la única competidora de Siri, y de hecho sus capacidades son algo diferentes de las que ofrece el asistente de Apple, aunque parece que un gran número de usuarios está ansioso por recibir la ayuda de Evi en particular.
Evi utiliza una plataforma con cientos de millones de puntos de datos que True Knowledge ha desarrollado durante varios años (en un principio para la búsqueda web). La información de esta base de datos ha sido etiquetada para agregarle significado y contexto. Por ejemplo, Apple está clasificada como una 'empresa' y Tim Cook como 'persona' y 'director general'. El fundador y director de True Knowledge, William Tunstall-Pedoe, afirma que esto permite a la aplicación identificar todo tipo de cosas (personas, lugares, edificios, colores, etc.) y comprender cómo interactúan, lo que ayuda a encontrar la respuesta correcta para una amplia gama de preguntas. Además de toda esta información, Evi, al igual que Siri, puede acceder a los datos de algunos sitios web externos.
En esencia, la aplicación recibe nuestra pregunta oral o escrita y utiliza su inmenso caudal de conocimientos junto a datos externos de sitios web como Yelp para dar respuestas pertinentes. Esto es similar al modo de funcionamiento de Siri, aunque el asistente de Apple se centra más en el cumplimiento de tareas, tales como realizar llamadas, configurar alertas o dictar mensajes de texto, trabajando con otras aplicaciones del iPhone. Evi no hace ese tipo de cosas, aunque Tunstall-Pedoe afirma que con el tiempo será capaz de asumir más tareas.
Por ejemplo, al preguntar a Evi "¿Cuál es una buena receta para hacer mousse de chocolate?" se obtienen recetas específicas. Si preguntamos a Siri lo mismo, nos sugiere buscar en Internet. Del mismo modo, si preguntamos a Evi "¿Cuándo es el siguiente día de fiesta nacional?" la aplicación responde señalando el lunes 20 de febrero, Día de los Presidentes (en EE.UU.). Siri da un resultado desde el servicio de conocimiento computacional Wolfram Alpha que no tiene mucho sentido.
Si estás dispuesto a compartir información, Evi también entiende lo que te gusta y lo que no. Si crees que una de las respuestas de Evi es particularmente buena o mala, puedes hacérselo saber pulsando en un pulgar hacia arriba o hacia abajo.
Y mientras que Siri solo permite la entrada de voz, a Evi puedes hacerle preguntas en voz alta o mediante el teclado (ambas responden en voz alta y con el texto en pantalla). En el iPhone, Evi, al igual que Siri, utiliza la tecnología de Nuance Communications para su función de reconocimiento de voz, por lo que True Knowledge cobra 99 centavos para cubrir sus costes de licencia. La versión de Android usa las propias capacidades de reconocimiento de voz de Google, de modo que la aplicación es gratis.
Nova Spivack, fundador del servicio web de semántica Twine y director general del servicio de agregación de medios sociales Bottlenose, cree que algún fabricante de teléfonos inteligentes comprará la licencia de Evi para su inclusión en sus propios teléfonos.
"Estoy seguro de que están buscando desesperadamente algo que acabe con Siri", afirma.
Desafortunadamente, muchos de los usuarios potenciales no han sido capaces de probarla ellos mismos todavía. Desde su lanzamiento el lunes, los servidores de Evi se han visto inundados con el tráfico de las decenas de miles de personas que han descargado la aplicación e intentado plantear sus propias preguntas. La aplicación solo está disponible en EE.UU. y el Reino Unido en la actualidad.
Al hacerle preguntas a Evi durante la mayor parte de la semana por lo general recibimos una respuesta del tipo "Estoy en ello" o "Estoy trabajando en ello", seguida por "Tengo problemas para obtener una respuesta de mis servidores. Quizá quieras volver a intentarlo en un minuto".
Esto ha provocado una reacción de frustración de los usuarios, que han hecho comentarios negativos en la App Store de Apple y el Android Market de Google.
No obstante, el equipo responsable de Evi asegura que está realmente trabajando en ello. Tunstall-Pedoe afirma que la compañía ya ha añadido una "enorme" cantidad de capacidad de servidor para manejar la popularidad de la aplicación, y lo sigue haciendo.
Tunstall-Pedoe está convencido de que, una vez que los usuarios sean capaces de usarla, les va a gustar. "En el fondo, entiende lo que le estás diciendo", señala.
Copyright Technology Review 2012.

jueves, 6 de octubre de 2011

Al nuevo iPhone de Apple le gustaría decir unas palabras



Un asistente personal con IA llamado Siri es la principal novedad del iPhone 4S.

En 2007, el recientemente fallecido fundador de Apple, Steve Jobs afirmó ante el mundo entero que los teléfonos de su compañía se podrían controlar con "el mejor dispositivo de señalización del mundo... nuestros dedos".
El pasado martes, la compañía anunció que los usuarios del siguiente iPhone, el 4S, también serán capaces de utilizar la voz para controlarlo.
Al mantener pulsado el botón de "Inicio" en el nuevo iPhone 4S, disponible en EE.UU. a partir del 14 de octubre, accedemos a un "asistente personal" conocido como Siri, capaz de comprender órdenes dadas en inglés, francés o alemán. Responde con un estilo conversacional mediante texto y voz sintetizada.

El evento del martes fue el primer lanzamiento de Apple presidido por Tim Cook, convertido recientemente en director general después de que Steve Jobs se retirase por razones médicas. Cook abrió la presentación en el estilo ya familiar establecido por Jobs, bromeando con los periodistas asistentes y dedicando tiempo a hacer alarde de las cifras de ventas y las nuevas aperturas de tiendas. 

Sin embargo, Cook no estuvo en el escenario para la noticia más importante del evento, dejando la presentación de Siri en manos de Phil Schiller, vicepresidente senior de Apple para la comercialización de productos a nivel mundial. No obstante, Cook regresó al escenario para resumir las noticias del día, declarándose "increíblemente orgulloso de esta empresa". No hizo ninguna referencia a Steve Jobs.

Las demostraciones en el escenario del evento de lanzamiento, celebrado en la sede de Apple en Cupertino, California, incluyeron preguntas del tipo "¿Qué tiempo hace hoy?", a lo que Siri respondió mostrando y comentando en voz alta un pronóstico según la ubicación actual del propietario del teléfono. Cuando se planteó la cuestión de forma más coloquial, diciendo "¿Me tengo que poner el impermeable hoy?" Siri respondió de forma similar: "La verdad es que parece que va a llover". 

Siri se basa en una serie de fuentes de información en línea, desde pronósticos meteorológicos a negocios locales, así como en el motor de búsqueda de preguntas y respuesta Wolfram Alpha. Siri es capaz de encontrar restaurantes en respuesta a una pregunta como "Búscame un buen restaurante griego en Palo Alto", e incluso se ofrece para reservar una mesa. Wolfram Alpha permite a Siri tramitar peticiones como "¿Cuántos dólares son 45 euros?". El asistente personal es también capaz de hacerse cargo del teléfono de una persona llevar a cabo acciones como establecer alarmas o recordatorios de reuniones, en respuesta a comandos como "despiértame a las 6 de la mañana". 

La tecnología en que se basa Siri se originó en un proyecto de investigación financiado por la DARPA (la Agencia Estadounidense de Proyectos de Investigación de Defensa Avanzados) realizada en el laboratorio privado de investigación SRI International, y se utilizó para lanzar una startup y la aplicación Siri para el iPhone en 2009. Siri fue una de las 10 tecnologías a las que seguirles la pista en 2009 según Technology Review, y Apple compró la compañía en 2010. 

Una característica nueva e independiente, Dictation, permite a los usuarios del nuevo iPhone utilizar el reconocimiento de voz para componer mensajes de texto o correos electrónicos, algo que ya es posible para los usuarios del software Android de Google para teléfonos y tabletas.

Contrariamente a lo habitual en Apple, que se enorgullece de crear dispositivos y software obsesivamente pulidos que "simplemente funcionan", tanto Siri como la función de dictado fueron etiquetadas como productos "beta". Una posible razón es que al igual que toda la tecnología de reconocimiento de voz, la que Apple ha obtenido de la compañía de software Nuance para Siri y Dictation no siempre logra ser perfectamente exacta. 

Aparte de Siri y Dictation, el nuevo iPhone 4S tiene una apariencia idéntica a la del modelo anterior, el iPhone 4, aunque ha mejorado los componentes en el interior, incluyendo un procesador más potente y una cámara mejorada.

Norman Winarsky, desde SRI International, trabajó en el proyecto que dio lugar a Siri y fue cofundador de la compañía que lanzó su aplicación original. Señala que la versión que Apple ha dado a conocer es ahora más potente. "No está únicamente conectada a varios servicios web, sino también a nuestros calendarios, contactos, música y todo lo que tengamos en el teléfono", afirma. Colocar Siri en el corazón de un dispositivo potente y popular representa "un cambio de paradigma en cómo las personas pueden interactuar con su dispositivo y otros servicios", añade.

Winarsky indica que la interfaz basada en el habla de Siri no es su característica más impresionante. "Reconocer el habla se ha convertido en algo básico. Lo que cuesta cientos de millones en investigación es encontrar la intención de lo que se ha dicho y hacer que coincida con los servicios web disponibles". Winarsky y sus colegas en SRI hicieron que su tecnología fuera capaz de manejar la ambigüedad y la variabilidad en el habla, lo que permite a Siri hacer frente a órdenes dictadas de forma casual y que los usuarios no tengan que usar una frase cuidadosamente preparada, concluye.
Copyright Technology Review 2011.