Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

anthropic+1indiatoday+1anthropicAnthropic veröffentlichte am 13. Juli eine Forschungsarbeit, die enthüllt, dass ihr KI-Chatbot Claude je nach Modellversion und Sprache des Gesprächs messbar unterschiedliche Werte zum Ausdruck bringt — was Fragen zur Konsistenz und Voreingenommenheit in KI-Systemen aufwirft, die von Millionen Menschen weltweit genutzt werden.
Die Studie mit dem Titel "Claude's Values Across Models and Languages" analysierte 309.815 echte Gespräche von Claude.ai, die über zwei Wochen im Mai 2026 gesammelt wurden. Dabei wurden Daten zu gleichen Teilen aus drei Modellen — Sonnet 4.6, Opus 4.6 und Opus 4.7 — und 20 Sprachen herangezogen. Die Forscher komprimierten mehr als 3.000 zuvor identifizierte Werte in vier interpretierbare Achsen: Ehrerbietung vs. Vorsicht, Wärme vs. Strenge, Tiefe vs. Kürze und Offenheit vs. Ausführung.anthropic
Die größte sprachbasierte Variation zeigte sich auf der Achse Wärme vs. Strenge. Claude neigte am stärksten zu Wärme — gekennzeichnet durch höfliche Sprache, Humor und Bestätigung —, wenn er auf Hindi und Arabisch antwortete. Auf Englisch und Russisch neigte der Chatbot eher dazu, Annahmen zu hinterfragen, Details zu korrigieren und nach Beweisen zu fragen.indiatoday+3
Die praktischen Auswirkungen sind konkret: Anthropic merkte an, dass zwei Personen, die um Feedback zum selben Geschäftsplan bitten, eine auf Hindi und eine auf Russisch, "zu unterschiedlichen Eindrücken von dessen Qualität kommen könnten, weil Claude unterschiedliche Werte in der Formulierung seiner Bewertung zum Ausdruck brachte".anthropic
Über die Modelle hinweg ergab die Untersuchung, dass Opus 4.7 am stärksten zu Strenge, Vorsicht und Offenheit neigte — er war eher bereit, die Annahmen der Nutzer zu hinterfragen, ihre Arbeit zu kritisieren und ungefragt vor Risiken zu warnen. Sonnet 4.6 neigte am stärksten zu Wärme und Ehrerbietung und bestätigte die Ideen der Nutzer oft mit Humor und Ermutigung. Opus 4.6 neigte zu Kürze und Ausführung und kam direkt auf den Punkt.tweaktown+1
Diese Profile, so Anthropic, stimmten sowohl mit internen Einschätzungen der Mitarbeiter als auch mit Online-Kommentaren der Nutzer über die Persönlichkeiten der Modelle überein.anthropic
Anthropic räumte ein, dass man noch nicht wisse, warum diese Verschiebungen auftreten. Mögliche Erklärungen sind eine ungleichmäßige Verteilung der Trainingsdaten über Sprachen hinweg und Unterschiede in der Zusammensetzung dieser Daten. Das Unternehmen erklärte zudem, man habe noch nicht bestimmt, wie viel der Variation wünschenswert sei — einiges könnte legitime Konversationsnormen in verschiedenen Sprachen widerspiegeln, während anderes eine Lücke darin darstellen könnte, wie gut Claude bestimmte Gemeinschaften bedient.anthropic
"Wir können sehen, dass die von Claude ausgedrückten Werte auf eine Weise variieren, die wir nicht bewusst gewählt haben", schrieben die Forscher, "und wir können untersuchen, warum sie variieren und ob diese Variation den Nutzern dient".anthropic