Visão agente: Construindo inteligência visual com servidores Amazon Bedrock e MCP
A integração da IA em aplicações do mundo real tem sido dificultada há muito tempo por um desafio fundamental: a desconexão entre sistemas que podem ver, sistemas que podem pensar e sistemas que podem agir. Os desenvolvedores têm lutado com integrações complexas, gerenciando diversas APIs e criando soluções personalizadas para preencher essas lacunas, resultando em implementações ineficientes, caras e muitas vezes frágeis. Estamos convergindo as três tecnologias principais: Visão Computacional, Agentes de Strands e Model Context Protocol (MCP).
Juntos, eles criam um pipeline onde as informações visuais podem ser capturadas, compreendidas e utilizadas dentro de uma estrutura unificada. Esta integração reduz as barreiras tradicionais entre percepção, tomada de decisão e ação, permitindo que os sistemas de IA operem mais como a inteligência humana, vendo, compreendendo e respondendo de forma coordenada. Nesta postagem, orientamos você no Servidor MCP de Visão Computacional, que ilustra essa abordagem, representando como os sistemas de IA podem processar informações visuais e tomar decisões inteligentes por meio de uma interface única e padronizada.
Esta convergência transforma o que antes era um desafio de integração complexo num processo simplificado, tornando as capacidades de IA acessíveis a uma gama mais ampla de aplicações e desenvolvedores. Em nossa arquitetura, o cliente interage com vários Amazon Web Services (AWS) por meio de uma função centralizada do AWS Identity and Access Management (IAM), que serve como gateway de segurança para gerenciar permissões. O Amazon Simple Storage Service (Amazon S3) lida com o armazenamento de objetos para recuperar e gerenciar dados.
O Amazon OpenSearch fornece recursos de pesquisa para consultar os dados indexados. O Amazon Bedrock oferece modelos generativos de IA, concedendo ao cliente acesso a ferramentas de IA para tarefas como geração de texto para o agente. Por fim, o Amazon Rekognition é especializado em análise de imagens, realizando funções como detecção de objetos.
A arquitetura enfatiza um modelo de segurança unificado, onde a função IAM centraliza o gerenciamento de permissões, o que elimina a necessidade de credenciais incorporadas no cliente e simplifica o acesso controlado em vários serviços da AWS. A solução utiliza três tecnologias principais. A visão computacional se concentra no processamento de informações visuais, como fotos e vídeos.
Strands Agents é uma estrutura para a construção de agentes de IA que oferece suporte a vários provedores de modelos e alvos de implantação, oferecendo um loop de agente personalizável com recursos de produção, incluindo observabilidade, rastreamento e implantação escalonável. Por último, o Model Context Protocol (MCP) é um padrão projetado para simplificar a forma como os sistemas de IA se integram a ferramentas e fontes de dados, substituindo o processo de construção de conexões separadas para cada modelo de IA e par de fontes de dados. A interface apresenta uma interface de bate-papo Streamlit.
No lado esquerdo, há um painel de menu onde os usuários podem selecionar seu modelo de base preferido para análise, padronizado como Claude 4 Sonnet com recursos de raciocínio que incluem as opções Claude 4 Sonnet e Claude 3.7 Sonnet. Os usuários também podem redefinir seu histórico de conversas por meio de um botão dedicado nesta barra lateral. Para usar este aplicativo, os usuários podem fazer upload de seu conteúdo visual por meio da seção proeminente de upload de mídia no centro da interface.
O sistema aceita imagens e vídeos, suportando uma ampla variedade de formatos, incluindo PNG, JPG, JPEG, GIF, WEBP para imagens e MP4, AVI, MOV, MKV, WEBM, MPEG4 para vídeos, com limite máximo de tamanho de arquivo de 200 MB. Os usuários podem arrastar e soltar seus arquivos diretamente na área de upload designada ou selecionar Procurar arquivos para selecionar manualmente os arquivos de seu dispositivo. Após o upload da mídia, o sistema de IA pode realizar várias tarefas de análise, como corte de objetos, detecção de rótulos e análise detalhada de conteúdo.
Os usuários podem então interagir com o sistema por meio do campo de entrada de mensagens na parte inferior da interface, fazendo perguntas específicas sobre a mídia carregada ou solicitando tipos de análise. A seguir está o prompt do sistema usado pelo agente: Nossa implementação é composta por dois servidores, nomeadamente o servidor CV e o servidor OpenSearch. Cada um lida com diferentes tipos de solicitações, conforme descrito na seção a seguir.
O servidor AWS Computer Vision MCP fornece uma interface unificada para análise de imagens e vídeos, consolidando três serviços Amazon AI em um protocolo padronizado. Essa integração permite que os agentes de IA acessem e processem conteúdo visual por meio de uma API consistente, que agiliza o desenvolvimento de aplicativos de visão computacional. The following tools are available in the MCP server: Agent Response: I’ll help you describe the uploaded image.
Deixe-me analisá-lo primeiro usando o agente de visão computacional. Agora vou exibir a imagem com a descrição: A imagem enviada mostra uma cena rural ao ar livre apresentando: A imagem captura uma cena rural tranquila com as ovelhas posicionadas no centro do quadro contra o pano de fundo de prados verdes. As cores dominantes são vários tons de verde no fundo (representando os pastos) e tons de cinza/branco das ovelhas em primeiro plano.
Esta é uma fotografia da natureza que captura o gado no seu ambiente pastoral natural, mostrando as ovelhas a pastar num campo aberto. O seguinte trecho de código da ferramenta description_image representa a estrutura geral de uma ferramenta: Resposta do agente: ajudarei você a analisar o vídeo enviado. Deixe-me delegar esta tarefa ao especialista em visão computacional.
Analisei seu vídeo enviado (15dc6b31_19642406-uhd_3840_2160_30fps.mp4) e aqui está o que encontrei: Resposta do agente: ajudarei você a detectar rótulos em sua imagem enviada. Let me analyze it using the computer vision specialist.Now that I’ve analyzed the image, let me display it with the detected labels:## Image Label Detection Results The computer vision analysis detected the following labels in your image: The image primarily shows multiple kittens or cats relaxing on a grassy lawn area. O servidor OpenSearch MCP fornece uma interface unificada para ingestão e recuperação de imagens.
As seguintes ferramentas estão disponíveis no servidor MCP: Resposta do Agente: Ajudarei você a encontrar imagens semelhantes àquelas fornecidas no índice “imagens”. Deixe-me analisar esta imagem primeiro e depois procurar outras semelhantes. Com base nos resultados da pesquisa, encontrei uma imagem semelhante no "índice de imagens que corresponde à sua consulta.
Deixe-me mostrar a imagem original e a semelhante que encontrei: encontrei uma imagem semelhante à que você forneceu no índice" imagens ". A pontuação de similaridade entre essas imagens é 0,65 (em uma escala onde maior é mais semelhante), indicando uma boa correspondência com base nos elementos visuais e no contexto de ambas as imagens. Ambas as fotos capturam corujas em seu habitat natural de floresta com composição e assunto semelhantes.
Você gostaria Para procurar mais imagens semelhantes usando palavras-chave diferentes ou gostaria de obter mais informações sobre qualquer uma dessas imagens de coruja? Agora que examinamos os diferentes recursos do aplicativo, passaremos pelo processo de implantação. Para começar, certifique-se de ter o seguinte instalado: Para implantar a solução, siga o README encontrado no repositório GitHub.
Clique aqui para abrir o console da AWS e acompanhar. implementar recursos de análise visual sem as complexidades tradicionais de configuração e manutenção de infraestrutura extensa. Essa configuração permite que os desenvolvedores executem tarefas como gerar caixas delimitadoras para objetos detectados, criar descrições detalhadas de imagens e analisar conteúdo de vídeo, tudo sem a necessidade de servidores dedicados ou sistemas de gerenciamento complexos.
💬 Comentários
Carregando comentários…