Páginas

Mostrando las entradas con la etiqueta Gemini. Mostrar todas las entradas
Mostrando las entradas con la etiqueta Gemini. Mostrar todas las entradas

martes, 27 de febrero de 2024

SORA y GEMINI Proyectos Distintos de IA

 Centro Educativo Madre Teresa de Calcuta

Informática Educativa

SORA y GEMINI

Proyectos De Inteligencia Artificial (IA)

Distintos con Grandes Potenciales

Sora


Gemini


Google y OpenAI mostraron sus últimas innovaciones en inteligencia artificial. Primero fue Google con Gemini 1.5, su modelo de IA con un millón de tokens para aventajar a GPT-4 Turbo. Inmediatamente después OpenAI contraatacó con Sora, su modelo de texto a vídeo para generar clips de hasta 60 segundos.

Y las reacciones de la comunidad no han podido ser más distintas. La nueva versión de Gemini es muy prometedora y apunta altísimo, pero hay una diferencia clara con Sora. Mientras Google nos da cifras de vértigo, OpenAI nos enseña vídeos. Si una imagen vale más que mil palabras, en este caso un vídeo vale más que mil cifras.

Son dos estrategias muy distintas, pero parece claro cuál está generando más atención. Del anuncio de Gemini 1.5 nos quedamos con que mientras GPT-4 Turbo tiene 128.000 tokens, Gemini llega a un millón. Estos tokens son un indicativo de la capacidad de la IA de recibir mucha información a la vez. Es decir, Gemini es capaz de leer una mayor cantidad de libros a la vez o de procesar una mayor cantidad de tiempo de vídeo. En resumen: es más rápida y eficiente. Hasta ahí bien.

Lo que ocurre es que esta promesa de un mayor rendimiento no sirve de mucho si no tenemos presente ejemplos llamativos. Tras probar Gemini en el móvil, nuestra experiencia ha sido más o menos buena pero no revolucionaria.

Cifras versus ejemplos

Si uno mira el comunicado de Gemini 1.5 de Sundar Pichai y Demis Hassabis veremos un texto con muchos ejemplos y muchísimas cifras. Tokens, arquitectura, tiempos de ejecución y líneas de código. ¿En qué se traduce eso en nuestras vidas diarias? Difícil determinarlo en el corto plazo.

Con Sora ha sido muy distinto. En primer lugar, la página de Sora viene con múltiples ejemplos de vídeos. El resultado es impresionante, con un realismo no visto hasta ahora. Pero es que incluso si leemos el texto técnico está plagado de ejemplos gráficos.

Lógicamente la comparativa no es justa. Sora es una herramienta de vídeo y Gemini es un modelo de IA. Son dos proyectos muy distintos, pero precisamente por ello la reacción que generan es diferente. OpenAI sabe que su mayor baza está en lo llamativo que pueden llegar a ser la IA, para Google la IA parece que sea un impulso a optimizar su gran engranaje.

Todavía cuesta encontrar ejemplos en Gemini que no se puedan hacer desde hace tiempo en ChatGPT. Unos y otros consiguen mejores resultados en función del prompt pero de manera general, están bastante a la par. Pero los movimientos de OpenAI dejan claro de un vistazo que están un paso por delante.

Gabor Cselle, ex directivo de Google, publica una comparativa entre el vídeo generado por Sora y lo que ofrecen alternativas como Pika, RunwayML o Stable Video y su conclusión es que Sora es un paso adelante claro, sobre todo en consistencia y duración. "Revolucionario", describe. 

Sora no está disponible al público todavía, pero ya ha enseñado decenas de ejemplos. Vídeos tan sorprendentes que no hace falta mucha más explicación para saber que estamos ante un salto importante. Algo que Google todavía no ha logrado. 

Fuente Bibliográfica:

https://www.xataka.com/robotica-e-ia/google-sigue-atascada-gemini-sora-demuestra-quien-va-muchos-pasos-delante-ia-openai

https://cdn.openai.com/sora/videos/closeup-man-in-glasses.mp4

miércoles, 21 de febrero de 2024

GEMINI Inteligencia Artificial de Google

 Centro Educativo Madre Teresa de Calcuta

Informática Educativa

GEMINI Inteligencia Artificial de Google

Gemini IA de Google, centrándonos en la versión web que está accesible para todos. Vamos a usar la versión gratis de Gemini, que por dentro lleva el modelo de inteligencia artificial Gemini Pro comprable o semejante al GPT-3.5 que usa ChatGPT.

Google Gemini es el nuevo nombre de la IA que conocíamos como Google Bard hasta ahora. Lo que ha pasado es que le han cambiado el modelo de inteligencia artificial que usaba por otro más potente, y Google ha aprovechado para cambiar también su nombre. Todavía no ofrece todas las opciones que la empresa del buscador pretende, pero como verás sí que ofrece las suficientes para darte mucho juego.

Google Gemini te va a responder siempre en el mismo idioma en el que le escribas. Si eres un usuario de habla hispana, podrás hablarle en español y te responderá en el mismo, y cuando lo prefieras podrás saltar a otro idioma para hacer peticiones concretas.

Por ejemplo, puedes estar utilizándolo en español, y cuando quieras puedes pedirle que te responda en inglés. Esto podrás hacerlo escribiendo tu prompt en inglés o simplemente diciéndole en el prompt en español que quieres el resultado en inglés. Aquí, simplemente debes saber que puedes usarlo en idiomas muy hablados como inglés, francés, español, alemán, portugués, etcétera, pero no en otros idiomas menos hablados como Euskera, Gallego o Catalán.

Gemini IA, te ofrece las opciones de calificar las respuestas que te ofrece. Cuando Gemini te diga una respuesta, debajo de ella aparecerán varios botones. Los dos primeros servirán para calificar la calidad de la respuesta, pudiéndole dar una nota positiva o negativa. Así, los desarrolladores de esta IA podrán saber qué respuestas son mejores o peores, y trabajar en mejorarlas.

Si calificas la respuesta como mala, entonces vas a tener la opción de explicarle a Google por qué la consideras mala. Podrás etiquetarla como ofensiva, decir que tiene datos incorrectos o añadir otra razón, y también tendrás un campo de escritura en el que especificar todo lo que quieras tu mala calificación.

Otra de las opciones que ofrece Gemini es la de modificar las respuestas de forma rápida y sin necesidad de pedírselo mediante un prompt. Para eso, tienes varias opciones rápidas que te aparecen con el botón de ajustes justo debajo de cada una de las respuestas.

Con estas opciones vas a poder hacer las respuestas más cortas o más largas, también podrás cambiar el tono de la escritura para que sea más sencillo, más informal o más profesional. Estos cambios también los puedes hacer pidiéndoselos por escrito, e incluso hacer otro tipo de cambios en el tono de escritura, pero estas son opciones rápidas para que puedas hacerlo de forma más sencilla.

La IA te permite mediante expresiones de Prompts, que te redacte el texto acorde a lo que le estas solicitando. Por ejemplo; Como te hemos dicho en el punto anterior, puedes pedirle manualmente a Gemini que te escriba respuestas de maneras distintas. Una de las más útiles es pedirle que te explique algo como si tuvieras cinco años. Así, podrás obtener explicaciones mucho más básicas y sencillas. Aquí, hay dos maneras de proceder. Puedes pedirle que te lo explique como un niño de cinco años después de que te dé una respuesta, o directamente pedirle que te explique algo de esa manera desde el principio.

A Gemini IA de Google, puedes hacerle cualquier tipo de consulta, preguntarle cualquier cosa que quieras saber para que te de la información. Cuando lo hagas, la IA te enviará la respuesta al momento.

Aquí, debes saber que la gran diferencia de Gemini frente a alternativas como ChatGPT es que las respuestas las genera con resultados de Internet. Esto quiere decir que van a estar siempre actualizadas, y que el conocimiento no llegará solo hasta una fecha determinada.

Como Google Gemini obtiene parte de la información de sus respuestas de Internet, vas a tener la opción de revisar de dónde ha sacado algo para poder comprobar su veracidad. Para eso, tienes un botón Comprobar respuestas con el icono de Google debajo de cada una de ellas, con esto, los fragmentos extraídos de alguna web quedarán subrayados para que los puedas distinguir.

Aquí, cuando un fragmento quede subrayado podrás pulsar en él para que Gemini te enseñe de qué web ha sacado la información. Podrás consultar directamente la web para poder comprobar su veracidad y saber si es una página fiable o no.

Es posible que cuando le hagas una petición a Gemini, la inteligencia artificial no acierte a la primera. No quiero decir que te de malos resultados, sino que quizá simplemente no lo hace expresándose de la manera que quieres. Para no tener que volver a escribir el mismo prompt, Gemini te ofrece tres respuestas distintas para que puedas alternar entre ellas.

Para verlas, entre tu prompt y la respuesta de Gemini puedes pulsar en Mostrar versiones. Al hacerlo, se abrirá una ventana donde puedes ver las tres versiones de respuestas que te ha generado, y tienes también un botón de recargar para volver a generar otras distintas.

Arriba a la derecha de cada respuesta, tienes un botón con el icono de un altavoz. Si pulsas sobre él, Gemini leerá tu respuesta para que puedas escucharla. Esto puede servirte si en algún momento no quieres pararte a leer y te es más cómodo escucharlo.

Gemini ha sido entrenada como una inteligencia artificial multimodal. Esto quiere decir que es capaz de entender tu voz además de tu texto. De hecho, ya en su página web tienes el icono de un micrófono para poder activar el dictado.

Aquí, vas a necesitar darle al navegador web que utilices permiso para poder utilizar el micrófono, y evidentemente también necesitas tener un micrófono en el dispositivo desde el que vayas a usarlo. Entonces, mantén pulsado el botón y habla.

Gemini IA de Google, también puedes subir una foto y Gemini te reconocer la foto y te dirá lo que está leyendo o reconociendo que posee esa foto. Por eso, a la derecha del cuadro de texto tienes un icono para subir fotografías desde tu dispositivo. Una vez subas la foto, puedes enviarla junto a algún prompt o petición. Por ejemplo, puedes preguntarle lo que aparece en la foto, y Gemini te dirá lo que ve dentro de la fotografía incluyendo los textos que aparecen en ella con pasmosa precisión. Vas a poder hacerle cualquier pregunta relacionada con la fotografía y su contenido, y Gemini te responderá. Incluso vas a poder hacerle preguntas relacionadas con los datos EXIF que pueda tener la foto, como la fecha y la hora en la que fue tomada.

Cuando le hagas cualquier consulta a Gemini, vas a poder generar un enlace para compartir la respuesta. Para eso, en la serie de iconos que tienes justo debajo de las respuestas verás uno que es precisamente para compartir.

Vas a tener dos opciones. Por una parte, vas a poder compartir solo una petición su correspondiente respuesta, y por otra parte podrás compartir toda la conversación y todo lo que has hablado con Gemini en ella. Puedes incluso generar nuevas respuestas antes de compartirla, y todo ello se compartirá con un enlace público.

Con Gemini IA de Google, puedes hacer muchísimas cosas más, como: que te redacte un email, que te escriba un código HTML para crear una página web, que te redacte cualquier fórmulas de Excel, para funciones específicas que necesites, que te escriba guiones de redes sociales, redacte pequeños escritos, redacte artículos, crear exámenes, crear estructura para un texto, mejorar los textos, como por ejemplo de la Prompt  "mejórame el estilo de este texto para hacerlo más claro:", Cuando obtengas el resultado, Gemini te dará una lista con las mejoras que ha realizado, e incluso te añadirá otras sugerencias para añadir al texto y hacerlo más atractivo, teniendo en cuenta el tipo de texto que haya visto que es.

Puedes también, crear poemas, o letras de canciones, análisis descriptivo de un dispositivo X tecnológico, guía de compras, crear menús y recetas, te sugiere películas, series, juegos, libros, juegos (en textos, por ejemplo; juego de preguntas y respuestas), crear frases y chistes, organizar tus vacaciones, y muchas cosas más…

Fuente Bibliográfica:

https://www.xataka.com/basics/36-funciones-cosas-que-puedes-hacer-google-gemini

viernes, 5 de enero de 2024

El potencial de Gemini en la Inteligencia Artificial

 Centro Educativo Madre Teresa de Calcuta

Informática Educativa

 

El potencial de Gemini en la Inteligencia Artificial de Google

Google presentó recientemente Gemini, su última inteligencia artificial de última generación, marcando un avance significativo en las tecnologías. La plataforma, disponible para prueba desde esta semana, introduce características notables destinadas a redefinir el panorama de las capacidades de la inteligencia artificial.

Gemini se presenta en tres versiones distintas, adaptándose a diversas necesidades de los usuarios. El Gemini Nano, diseñado para dispositivos móviles, encabeza la lista, seguido por el intermedio Gemini Pro. La joya de la corona del trío, Gemini Ultra, supera a GPT-4 de OpenAI en diversos benchmarks, según revela Google.

Para explorar las capacidades de Gemini, Google presenta a los usuarios alternativas convincentes. Es importante destacar que la versión Ultra está programada para su lanzamiento a principios del próximo año, con algunas limitaciones regionales y de idioma a tener en cuenta.

Bard: revelando las habilidades de Gemini

Bard, el chatbot impulsado por inteligencia artificial de Google posicionado como un competidor directo de ChatGPT, se presenta como la puerta de entrada principal para probar las capacidades de Gemini. La iteración inicial de Gemini aplicada en Bard está disponible en 170 países, aunque actualmente se limita a los comandos de texto en inglés.

Pruebas realizadas desde Argentina, arrojaron resultados intrigantes con matices notables. Una observación interesante es que Bard, cuando se le pregunta en español sobre su uso de Gemini, lo niega. Sin embargo, al hacer la misma pregunta en inglés, Bard reconoce su integración con Gemini, proporcionando un resumen de las nuevas características de la inteligencia artificial de Google.

Es crucial iniciar una conversación con Bard en inglés desde cero para una prueba óptima de Gemini. Cambiar de español a inglés dentro del mismo chat resulta en que Bard responde en inglés sin aprovechar la nueva inteligencia artificial.

Durante su lanzamiento, Google anunció que Bard ahora está impulsado por Gemini Pro, alineando sus capacidades con o incluso superando las de GPT-3.5. El inminente lanzamiento de Gemini Ultra intensificará aún más la competencia, con una versión dedicada de Bard llamada Bard Advanced.

Al preguntar directamente sobre la versión de Gemini de Bard, identificó explícitamente a Gemini Pro como la inteligencia artificial avanzada, un pequeño error considerando la existencia de la variante Ultra. No obstante, esta pequeña discrepancia se puede pasar por alto.

Explorando las capacidades de Bard con Gemini

Google enfatiza la funcionalidad de Bard con comandos de texto en inglés, pero también admite archivos adjuntos de imágenes. Los usuarios pueden solicitar análisis de imágenes, aprovechando metadatos para obtener contexto adicional más allá del contenido de la imagen.

Bard, potenciado por Gemini, puede generar código en varios lenguajes de programación, mejorando las capacidades existentes. Aunque esta función ya existía, ahora incorpora varias mejoras.+

Además, los usuarios pueden pedirle a Bard que cree poemas o historias, aunque actualmente la plataforma no puede acompañarlas con imágenes generadas de forma sintética, una característica disponible en ChatGPT con DALL-E 3.

Limitaciones y mejoras futuras

El uso de Gemini dentro de Bard actualmente se limita a comandos de texto en inglés, y Google promete soporte para más idiomas en el futuro sin especificar detalles. También existen restricciones para cargar imágenes; Gemini no puede analizar imágenes que incluyan personas, incluso si son figuras públicas.

Es importante destacar que existen restricciones regionales, con Bard y Gemini accesibles en 170 países pero notablemente ausentes en Europa. La ausencia en la UE puede atribuirse a consideraciones regulatorias, ya que Google introdujo el chatbot más tarde en la región. Aunque la disponibilidad europea no está especificada, Google menciona vagamente que será en el "futuro cercano".

La página de soporte de Bard de Google proporciona una lista completa de los países donde está disponible la versión potenciada por Gemini Pro. Actualmente, no es posible cambiar manualmente la región en la plataforma web del chatbot. Sin embargo, los usuarios en la UE pueden explorar la plataforma utilizando una VPN como una posible solución alternativa.

Gemini de Google emerge como una inteligencia artificial innovadora, integrada sin problemas en Bard, ofreciendo a los usuarios un vistazo al futuro de las interacciones impulsadas por la inteligencia artificial. A medida que la plataforma evoluciona y se abordan las limitaciones regionales, Gemini está destinado a desempeñar un papel fundamental en la configuración del panorama de la inteligencia artificial.

Fuente Bibliográfica:

https://www.iprofesional.com/tecnologia/395624-gemini-como-usar-la-nueva-inteligencia-artificial-de-google

domingo, 24 de diciembre de 2023

Google Gemini vs Google Bard

Centro Educativo Madre Teresa de Calcuta

Informática Educativa

 

Google Gemini vs Google Bard

Inteligencia Artificial

Google Gemini es un proyecto de inteligencia artificial desarrollado por Google. Se trata de un sistema que se perfila como un competidor directo de GPT-4 de OpenAI. La principal característica de Gemini es su capacidad multimodal, lo que significa que puede procesar y generar no solo texto, sino también trabajar con otros tipos de datos e interacciones. Esto lo hace un sistema más versátil y potente en comparación con otros modelos de lenguaje que se centran únicamente en el texto.

En cuanto a su presentación, Gemini fue anunciado en el evento Google I/O de 2023. Este evento es una conferencia anual de desarrolladores organizada por Google, donde la compañía suele presentar sus últimas innovaciones y desarrollos tecnológicos. Aunque se presentó en 2023, parece que solo veremos a Gemini en enero de 2024, dentro de pocas semanas.

Google Bard y Google Gemini son desarrollos de inteligencia artificial de Google, pero tienen diferencias clave en sus capacidades y aplicaciones.

Multimodalidad de Gemini: Una de las diferencias fundamentales entre Gemini y Bard es que Gemini es un sistema multimodal. Esto significa que no solo puede trabajar con texto, sino también con otros tipos de entradas y salidas, lo que lo hace más versátil y potente que Bard​​.

Integración de Bard en aplicaciones de Google: Bard, por su parte, se ha integrado en aplicaciones de Google como YouTube, Gmail y Drive a través de «Extensiones Bard». Esto permite a los usuarios colaborar con el chatbot mientras utilizan estos servicios​​.

Modelo de lenguaje subyacente de Bard: Bard se basa en LaMDA, un modelo de lenguaje desarrollado por Google durante dos años. Este modelo se centra más en el procesamiento del lenguaje natural​​.

Gemini como competidor de GPT-4: Gemini se presenta como un competidor directo de GPT-4 de OpenAI. Fue presentado en el I/O de 2023 y se espera que aporte mejoras significativas a la inteligencia artificial existente de Google, como Bard y Google Assistant​​.

Comparación con GPT-4: Gemini se describe como una versión más avanzada y potente de Bard, comparable a GPT-4 de OpenAI, que es una versión mucho más poderosa de ChatGPT 3.5​​.

Gemini puede ser clave en la creación del panel de IA que Google está preparando en su buscador, el panel que responderá a las preguntas que hagamos antes de mostrar los enlaces a los que estamos acostumbrados, estableciendo así un antes y un después de las búsquedas de información en Internet.

Fuente Bibliográfica:

https://wwwhatsnew.com/2023/12/05/google-gemini-vs-google-bard-en-que-se-diferencian/ 

sábado, 23 de diciembre de 2023

GEMINI Inteligencia Artificial de Google

 Centro Educativo Madre Teresa de Calcuta

Gemini

Inteligencia Artificial de Google

Google Gemini es un modelo de inteligencia artificial creado por Google, y que busca liderar el competitivo mercado de la inteligencia artificial. Los modelos de inteligencia artificial no son las aplicaciones o Chatbots como Google Bard, sino que son la tecnología con la que estos funcionan.

De hecho, Gemini quiere ser el sucesor de PaLM, que es el modelo de inteligencia artificial que actualmente utiliza Bard. El plan es que poco a poco PaLM vaya siendo reemplazado por Gemini dentro de Bard, por lo que aunque utilicemos el mismo bot de IA, las respuestas que nos de serán mucho mejores.

A la hora de presentarse, Gemini ha destacado por superar a todos sus rivales en los principales tests. Esto quiere decir que Google ha conseguido adelantar a OpenAI y su GPT-4, aunque tarde o temprano también llegará una nueva versión de este modelo que también lo supere.

Gemini es un modelo multimodal, que va a poder entender varios tipos de información, tanto los textos que le escribas como las imágenes, y también podrá entender audio y código de programación. Esto lo va a convertir en un modelo extremadamente flexible.

Cómo funciona Google Gemini

Los modelos de inteligencia artificial son entrenados de forma intensiva con una gran cantidad de datos. Se recopilan datos de todo Internet, y se le dan a los algoritmos de entrenamiento para que este sistema de lenguaje aprenda a entender las cosas que le digamos, tenga dentro de sí mismo la información con las respuestas, y consiga generar respuestas escritas que sean naturales.

En el caso de Gemini en concreto, Gemini ha sido diseñado desde cero por Google. Desde el principio ha sido creado como un modelo multimodal. Esto quiere decir que no se le ha entrenado para entender una fuente como el texto, y luego se le enseña a transformar otras fuentes a esta primera. Su entrenamiento ha sido distinto.

Este modelo se ha entrenado ya desde el principio para combinar distintas modalidades de forma nativa. Esto quiere decir que podrá entender tanto un texto como un dibujo que le hagamos en tiempo real. Según la empresa del buscador, también es capaz de relacionar objetos en tiempo real y sugerir canciones a medida que le damos indicaciones.

Gemini también introduce nuevo sistema de generación de código llamado AlphaCode2. Este sistema mejora la comprensión de matemáticas complejas y la teórica de ciencias de la computación. También se ha mejorado el razonamiento y su capacidad de entender código, de forma que haya menos "alucinaciones" y las respuestas sean más fiables.

Diferencias con GPT

Gemini tiene tres versiones diferentes: Ultra, Pro y Nano. Gemini Ultra es la más avanzada y multimodal, la segunda es más limitada en capacidades y funciones, y la versión Nano está enfocada a dispositivos con menos capacidades de computación y memoria, y así poder funcionar en teléfonos móviles.

Aunque parezca la menos potente, Gemini Nano es una de las mayores revoluciones, ya que podrá ser utilizada como una IA que se implementa directamente dentro del dispositivo. Esto quiere decir que no tendrás que usar una app que se conecte a un servidor de la IA como pasa con la de ChatGPT, sino que la IA podrá venir directamente en tu móvil y no necesitar conexión.

Para poder entender su capacidad, se puede comparar con el GPT de OpenAI. Para empezar, Gemini Ultra es el competidor de GPT-4, y supera a este otro lenguaje de IA en las pruebas actuales. Mientras Gemini Pro es el competidor de GPT 3.5, que es el que encontramos en ChatGPT gratuito. Por último, de momento Gemini Nano no se puede comparar con ningún producto de OpenAI.

Otra de las cosas que debemos diferenciar es que Gemini es multimodal y GPT no. Esto quiere decir que de forma nativa o "de fábrica" podrá entender fotos, audios, texto y más tipos de entrada sin tener que buscar implementar ningún tipo de complemento.

Cuándo llegará Gemini

Las distintas versiones de Gemini irán llegando de forma escalonada en los próximos meses. En primer lugar, Gemini Pro ha empezado a llegar ya a Google Bard. De momento, se podrá usar en inglés en más de 180 países, pero no en Europa, donde llegará en los próximos meses.

Más tarde, está previsto que Google lance un Bard Advance, una versión mejorada de Google Bard que integrará Gemini Ultra. Esto irá sucediendo a partir del año que viene, aunque todavía no hay fechas.

Y por último, Gemini Nano llegará a los móviles Pixel 8 Pro de Google. Además, también habrá un AICore, que es es un nuevo servicio para que los creadores de aplicaciones puedan usarlo e implementarlo en sus apps.

Además de Google Bard, Gemini también llegará a otros servicios y aplicaciones de la empresa. Para empezar, va a llegar al buscador Google, así como a Google Ads, Duet AI y el propio navegador Google Chrome. Todavía no hay fechas para estas llegadas, aunque sabemos que, a partir del 13 de diciembre, los desarrolladores podrán acceder a Gemini Pro a través de la API en Google AI Studio o Vertex AI.

Fuente Bibliográfica:

https://www.xataka.com/basics/google-gemini-que-como-funciona-diferencias-gpt-cuando-podras-usar-este-modelo-inteligencia-artificial