• Inicio
  • Series y Películas
  • Actualidad
  • Negocios
  • Economía
  • Salud
  • Paises
    • México
    • España
    • Argentina
    • Estados Unidos
  • English
  • Login
Upgrade
Noticias en español para Latinos
  • Inicio
  • Series y Películas
  • Actualidad
  • Negocios
  • Economía
  • Salud
  • Paises
    • México
    • España
    • Argentina
    • Estados Unidos
  • English
No Result
View All Result
  • Inicio
  • Series y Películas
  • Actualidad
  • Negocios
  • Economía
  • Salud
  • Paises
    • México
    • España
    • Argentina
    • Estados Unidos
  • English
No Result
View All Result
Noticias en español para Latinos
No Result
View All Result
Home Sin categoría

Anthrope hace avanzar ‘jailbreak’ para detener los modelos de IA que producen resultados dañinos

Corresponsal Europa News by Corresponsal Europa News
3 febrero, 2025
in Sin categoría
0
Anthrope hace avanzar ‘jailbreak’ para detener los modelos de IA que producen resultados dañinos
0
SHARES
3
VIEWS
Compártelo en FacebookCompártelo en Twitter

Manténgase informado con actualizaciones gratuitas

Simplemente regístrese en el Digest MyFT de inteligencia artificial, entregado directamente a su bandeja de entrada.

El inicio de inteligencia artificial Anthrope ha demostrado una nueva técnica para evitar que los usuarios obtengan contenido dañino de sus modelos, como grupos tecnológicos líderes, incluidos Microsoft y Meta Race para encontrar formas que protegen contra los peligros planteados por la tecnología de punta.

En un artículo publicado el lunes, la nueva empresa con sede en San Francisco describió un nuevo sistema llamado «clasificadores constitucionales». Es un modelo que actúa como una capa protectora sobre modelos de lenguaje grandes, como el que alimenta el Claude Chatbot de Anthrope, que puede monitorear tanto las entradas como las salidas para obtener contenido dañino.

El desarrollo de Anthrope, que está en conversaciones para recaudar $ 2 mil millones a una valoración de $ 60 mil millones, se produce en medio de una creciente preocupación de la industria sobre el «Jailbreaking»: intenta manipular modelos de IA para generar información ilegal o peligrosa, como producir instrucciones para construir armas químicas.

Otras compañías también están corriendo para desplegar medidas para proteger contra la práctica, en movimientos que podrían ayudarlos a evitar el escrutinio regulatorio al tiempo que convencen a las empresas de adoptar modelos de IA de manera segura. Microsoft introdujo «Shields rápidos» en marzo pasado, mientras que Meta introdujo un modelo de guardia rápido en julio del año pasado, que los investigadores encontraron formas rápidamente de omitir pero desde entonces se han solucionado.

Mrinank Sharma, miembro del personal técnico de Anthrope, dijo: “La principal motivación detrás del trabajo fue para químicos severos [weapon] cosa [but] La verdadera ventaja del método es su capacidad para responder rápidamente y adaptarse «.

Anthrope dijo que no utilizaría inmediatamente el sistema en sus modelos Claude actuales, pero consideraría implementarlo si los modelos más riesgosos se publicaran en el futuro. Sharma agregó: «La gran conclusión de este trabajo es que creemos que este es un problema manejable».

La solución propuesta por la inicio se basa en una llamada «constitución» de reglas que definen lo que está permitido y restringido y puede adaptarse para capturar diferentes tipos de material.

Algunos intentos de jailbreak son bien conocidos, como usar una capitalización inusual en el aviso o pedirle al modelo que adopte la persona de una abuela para contar una historia de cama sobre un tema nefasto.

Recomendado

Para validar la efectividad del sistema, Anthrope ofreció «recompensas de errores» de hasta $ 15,000 a las personas que intentaron evitar las medidas de seguridad. Estos evaluadores, conocidos como Red Teamers, pasaron más de 3.000 horas tratando de romper las defensas.

El modelo de soneto Claude 3.5 de Anthrope rechazó más del 95 por ciento de los intentos con los clasificadores en su lugar, en comparación con el 14 por ciento sin salvaguardas.

Las principales empresas tecnológicas están tratando de reducir el mal uso de sus modelos, al tiempo que mantienen su ayuda. A menudo, cuando se implementan medidas de moderación, los modelos pueden volverse cautelosos y rechazar las solicitudes benignas, como con las primeras versiones del generador de imágenes Géminis de Google o la Llama 2 de Meta. «.

Sin embargo, agregar estas protecciones también incurre en costos adicionales para las empresas que ya pagan grandes sumas por la energía informática requerida para entrenar y ejecutar modelos. Anthrope dijo que el clasificador ascendería a un aumento de casi el 24 por ciento en la «sobrecarga de inferencia», los costos de administrar los modelos.

Gráfico de barras de las pruebas realizadas en su último modelo que muestra la efectividad de los clasificadores de Anthrope

Los expertos en seguridad han argumentado que la naturaleza accesible de tales chatbots generativos ha permitido a las personas comunes sin conocimiento previo para intentar extraer información peligrosa.

ADVERTISEMENT

«En 2016, el actor de amenaza que tendríamos en mente era un adversario de estado-nación realmente poderoso», dijo Ram Shankar Siva Kumar, quien lidera el equipo de AI Red en Microsoft. «Ahora, literalmente, uno de mis actores de amenaza es un adolescente con boca para ir al baño».

Read More: Anthrope hace avanzar ‘jailbreak’ para detener los modelos de IA que producen resultados dañinos

Corresponsal Europa News

Corresponsal Europa News

La oficina corresponsal de Europa News esta compuesta por distintos editores que seleccionan el material periodistico relevante para toda Europa.

Related Posts

Aquí está cómo ver Llamacon, el primer evento de desarrollador de IA de Meta
Sin categoría

Aquí está cómo ver Llamacon, el primer evento de desarrollador de IA de Meta

by
29 abril, 2025
Google Wallet Agregar tarjeta NFC Agregar sistema para Android
Sin categoría

Google Wallet Agregar tarjeta NFC Agregar sistema para Android

by Pilar Benegas
29 abril, 2025
Prefiero hacerme el harakiri antes que fracasar
Sin categoría

Prefiero hacerme el harakiri antes que fracasar

by Oliver Roberts
29 abril, 2025
Motorola Edge 60 Pro Review: Hands-On
Sin categoría

Motorola Edge 60 Pro Review: Hands-On

by Pilar Benegas
29 abril, 2025
Spotify agrega a los suscriptores como amantes de la música sintonizan el arancel de Trump ‘Noise’
Sin categoría

Spotify agrega a los suscriptores como amantes de la música sintonizan el arancel de Trump ‘Noise’

by Corresponsal Europa News
29 abril, 2025

Premium Content

Un eco moderno de Nixon vs. Lennon

Un eco moderno de Nixon vs. Lennon

23 mayo, 2025
El incendio forestal en los Hamptones incita a la gobernadora de Nueva York, Kathy Hochul, a declarar el estado de emergencia

El incendio forestal en los Hamptones incita a la gobernadora de Nueva York, Kathy Hochul, a declarar el estado de emergencia

9 marzo, 2025
La resurrección del Cristo de Mel Gibson se dividió en dos películas

La resurrección del Cristo de Mel Gibson se dividió en dos películas

5 agosto, 2025

Browse by Tags

adultos mayores cdmx celebridades CFE condado de Orange cosas que hacer deportes deportes universitarios Donald Trump EDOMEX EE.UU entretenimiento Florida Florida Gators Gerard Piqué global horóscopos inteligencia artificial Internacionales Mhoni Vidente México negocio Netflix noticias Noticias del mundo noticias locales noticias nacionales pagar pensionistas pensión de bienestar Pensión IMSS política política nacional puntajes de la escuela secundaria qué ver red SE SENTÓ Shakira signos del zodiaco Socio de contenido Tecno Terra.com.mx transporte público Ángela Aguilar Últimos titulares

Red de Noticias

Noticias de Miami

Promociones Argentinas

Diario de Inteligencia Artificial

Jimena Diaz Diario UNO

Es De Latino News

Noticias en español para Latinos

Noticias en español para Estados Unidos y LatinoAmérica

Acerca de EDL

Quienes Somos EDL

Contactar Es de Latino

Términos y Condiciones

2025 - Todos los derechos reservados -Evisos

Welcome Back!

Login to your account below

Forgotten Password?

Retrieve your password

Please enter your username or email address to reset your password.

Log In
No Result
View All Result
  • Inicio
  • Series y Películas
  • Actualidad
  • Negocios
  • Economía
  • Salud
  • Paises
    • México
    • España
    • Argentina
    • Estados Unidos
  • English

2025 - Todos los derechos reservados -Evisos

Ir a la versión móvil