Hinweis: Diese Inhalte wurden mit Unterstützung von Künstlicher Intelligenz erstellt und redaktionell überprüft (Transparenzhinweis gemäß Art. 50 EU AI Act).
Praxis-Guide: Multimodale KI-Vision Pipelines mit Ollama¶
Multimodale LLMs (z. B. llava, qwen2-vl) verarbeiten sowohl Text als auch Bilder. Sie ermöglichen die automatische Analyse von Diagrammen, Screenshots, Belegen und Infrastrukturskizzen.
graph LR
Image["🖼️ Bild / Screenshot (.png/.jpg)"] --> Base64["🔤 Base64 Encoding"]
Base64 --> OllamaVision["🤖 Vision-LLM (LLaVA / Qwen2-VL)"]
Prompt["💬 Fragen zum Bild"] --> OllamaVision
OllamaVision --> Output["📊 Strukturierte Bildanalyse"]
🛠️ 1. Vision-Modell laden¶
🐍 2. Python Skript (vision_analysis.py)¶
import base64
import ollama
# 1. Bild in Base64 umwandeln
def encode_image(image_path):
with open(image_path, "rb") as image_file:
return base64.b64encode(image_file.read()).decode('utf-8')
# 2. Vision-Anfrage senden
def analyze_diagram(image_path: str, user_prompt: str):
response = ollama.chat(
model='llava',
messages=[
{
'role': 'user',
'content': user_prompt,
'images': [image_path]
}
]
)
return response['message']['content']
if __name__ == "__main__":
image_file = "server_architecture.png"
prompt = "Beschreibe die Serverarchitektur in diesem Diagramm und liste alle Komponenten auf."
print(f"Analysiere Bild '{image_file}'...")
analysis = analyze_diagram(image_file, prompt)
print("\nAnalyse-Ergebnis:")
print(analysis)
🔗 Verwandte Themen¶
- Lokales RAG & LLM-Serving – RAG mit Ollama
- Playwright & KI Web-Scraping – Web-Analysen
- PyAutoGUI OpenCV & OCR – Bildschirmsuche
Hinweis: Diese Inhalte wurden mit Unterstützung von Künstlicher Intelligenz erstellt und redaktionell überprüft (Transparenzhinweis gemäß Art. 50 EU AI Act).