PluToСсылка
Ссылка
click to show
click to show
1. Semantische Vektoren: Text wird tokenisiert; jedes Token wird zu einem Embedding-Vektor in einem hochdimensionalen „semantischen Raum“. Ähnliche Bedeutungen liegen dichter beieinander. ([jalammar.github.io][4])
2. Self-Attention als Abruf-Mechanismus: In jedem Layer erzeugt das Modell für jedes Token drei Projektionen (Q, K, V) und gewichtet frühere Tokens per
[
\text{Attention}=\mathrm{softmax}!\left(\frac{QK^\top}{\sqrt d}\right)V,
]
sodass die aktuelle Repräsentation genau die Kontexthinweise „anzieht“, die gerade relevant sind. Dadurch können Muster, Definitionen, Beispiele usw. im Verlauf einer Session aktiv „referenziert“ werden. ([papers.neurips.cc][1])
3. ICL als „Lernen ohne Gewichtsupdate“: Beim riesigen Vortraining sieht das Modell unzählige Textformen (Anleitungen, Tabellen, Q&A, Beispiele). Es lernt, aus dem Kontext eine Aufgabe zu erkennen und eine passende Fortsetzung zu produzieren. Theoretisch lässt sich zeigen, dass Transformer im Forward-Pass etwas Ähnliches wie ein kleines, kontextbasiertes Optimieren/Regressieren implementieren können—also eine Art Meta-Lernen. ([arXiv][5])
4. „Verankern“ in der Session: Alles, was du in die Unterhaltung legst—Definitionen, Beispiele, Stilregeln—wird als Aktivationen im Vektorraum repräsentiert. Über die Attention werden diese Aktivationen wieder und wieder herangezogen. So entsteht der Eindruck, das Modell hätte *innerhalb der Sitzung* etwas „gemerkt“. Tatsächlich bleiben die Gewichte unverändert; die „Erinnerung“ lebt im Kontextfenster der laufenden Eingabe. (Dieses Prinzip erklärt auch, warum klare, konsistente Beispiele so gut funktionieren.)
### Und wofür waren RLHF & Co.?
Instruction Tuning + RLHF bringen dem Modell bei, Anweisungen zu befolgen, höflich zu sein, Rückfragen zu stellen usw.—kurz: *menschenzentriertes Verhalten*. Das ist der Grund, warum Chat-LLMs so „hilfsbereit“ wirken; es ist *nicht* dasselbe wie ICL, sondern eine anschließende Ausrichtung. ([arXiv][3])
[1]: https://papers.neurips.cc/paper/7181-attention-is-all-you-need.pdf?utm_source=chatgpt.com "Attention is All you Need"
[2]: https://proceedings.neurips.cc/paper/2020/file/1457c0d6bfcb4967418bfb8ac142f64a-Paper.pdf?utm_source=chatgpt.com "Language Models are Few-Shot Learners"
[3]: https://arxiv.org/abs/2203.02155?utm_source=chatgpt.com "Training language models to follow instructions with human feedback"
[4]: https://jalammar.github.io/illustrated-transformer/?utm_source=chatgpt.com "The Illustrated Transformer - Jay Alammar"
[5]: https://arxiv.org/abs/2212.07677?utm_source=chatgpt.com "Transformers learn in-context by gradient descent"