Re: Normalverteilung
Hallo Marcel,
ich gebe bewusst keine Formeln an, in die man einfach nur Zahlen einsetzt.
Um Formeln sinnvoll einsetzen zu können, sollte man sie zunächst vollständig
verstehen.
Das wird selbst von Auszubildenden in technischen Berufen erwartet.
Yupp!
Wenn ein Auszubildender im Maschinenbau zum Beispiel glaubt, dass jede
Messung eine Schätzung sei, wird er seine Prüfung nicht bestehen.
Falsch, die Fehlerechnung aufgrund der Ungenauigkeit einer Messung ist Grundlage der Ausbildung eines Technikers. Oh, jetzt hab ich nochmal genau gelesen! Du sprichst vom mathematisch notwendigen Niveau eines Azubis! Der darf natürlich an die Genauigkeit seines "Gliedermaßstabs" oder des "Meßschiebers" glauben.
Von Ingenieuren wird außerdem erwartet, dass sie die Herleitung der Formeln
nachvollziehen können.
Das alles aus gutem Grund.
Jeder Techniker kennt folgende Sprüche und hat schon Anwendungsfälle gesehen:
Herr X misst Hausnummern
A fool with a tool is still a fool.
(Ein Narr mit Werkzeug bleibt ein Narr)
Trivialbeispiel: Herr X vermisst sich immer beim Messen mit dem Meter.
Man kauft ihm ein Messgerät mit Laserlängenmessung und hofft vergeblich, dass
jetzt keine Fehler mehr passieren.
Was bitte hat das mit der Auswertung von Stichproben zu tun?
Ich habe darum ausführlich die beteiligten Zufallsprozesse und Variablen
beschrieben, die ich in deinen Vorgaben finde und beschrieben, dass Du
erwartungstreue Schätzer mit bekannter Konvergenz brauchst, um das zu
erreichen, was Du ereichen willst.
Als erwartungstreuen Schätzer meinst du die Mittelwerte? Wenn ja, wird die Erwartungstreue durch die Konfidenzintervalle und n beschrieben. Und mit wachsendem n auch genauer!
Zudem würde ich gerne erstmal eine Menge Daten sammeln. Also nicht nur für mich.
Bei gentischen Daten klappt das ja auch.
Ich habe Dir das Beispiel der Funktion Limes(n->Unendlich)(n/(n +
Konstante)) gegeben.
Und ich habe dir das Bootstrap-Beispiel dazu gezeigt. Also anstatt am Ende auf 1 kommt man mit sehr vielen Ziehungswiederholungen dem Mittelwert oder den Populationgrenzen näher.
Für den Fall, dass ich unverständlich schreibe, habe ich Dir Quellen genannt,
die dasselbe noch ein Mal in einer anderen Form mit zusätzlichen
Informationen bringen.
Ich verstehe darum nicht, warum Du jetzt folgendes schreibst: "Begründe
bitte deine sehr großen Stichproben. Welchen Mehrwert haben sie gegenüber
einer Stichprobe aus 50 Messungen? Ja, das Konfidenzintervall wird
kleiner.
Wie soll denn "das Konfidenzintervall" kleiner werden?"
Wenn du dir die Formel für das Konfidenzintervall anschaust, wirst du es verstehen. Noch mal genauer: Ich meine das Konfidenzintervall des Mittelwerts.
Dass Schätzungen bei größerer Stichprobengröße genauer werden, wusste ich
schon als Grundschulkind.
Mein Opa war nämlich begeisterter Lottospieler.
Schon wieder machst du den gleichen Fehler! Ich rede hier über und programmiere mit der Mathematik zu endlichen Grundgesamtheiten. Du nicht! Bei mir ist immer n < unendlich!
Deshalb gehe ich auf den jetzt folgenden Abschnitt auch nicht weiter ein. Deshalb also jetzt hier weiter
Ich versuche jetzt noch ein Mal das mit deinem Problem zu zeigen: Du schätzt
den Mittelwert der Grundgesamtheit aus einer Stichprobe. Der Mittelwert
ist das erste Moment der Grundgesamtheit.
Du hast keine Information darüber, wie genau die Schätzung ist.
Wenn ich unter gleichen Bedingungen erneut eine Stichprobe ziehe, dann erwarte ich, dass der neue Mittelwert in der Regel innerhalb oder in der Nähe des vorher berechneten 95 %-Konfidenzintervalls liegt. Das muß erstmal reichen.
Du schätzt aus der Stichprobe weiterhin die Streuung - das zweite Moment. Du
weißt nicht, wie genau diese Schätzung ist.
Genau! Wie ich schon schrieb: Daten Daten Daten!
Ich habe mal gelernt, dass das benötigte n mit der Höhe der Momente steigt.
Um zu wissen zu können ab welchem n Du welche Genauigkeit hast, müsstest Du
die Wahrscheinlichkeitsfunktion der Grundgesamtheit kennen.
Wenn ich die Normalverteilungsfunktion für die Grundgesamtheit annehme, kann n sehr klein bleiben.
Ein kleines Beispiel: Es kann zum Beispiel vorkommen, dass eine Stichprobe
die Länge einer Spore auf 6 Einheiten schätzt, eine andere auf 8 eine
Dritte auf 10.
Es kann auch sein, dass die Schätzung viel besser ist: Du hast dann zum
Beispiel Messungen von 8.1, 8.2 und 8.3.
Ohne möglichst genaue Schätzungen über die Grundgesamtheit, weißt Du nichts
über deinen zu erwartenden Fehler.
Ich nehme i.d.R. Normalverteilung an. Das macht es einfacher und den Fehler präziser eingrenzbar.
Da Du das nicht hast, bleibt Dir nichts anderes übrig, als irgendwie mehr
Informationen über die Grundgesamtheit zu bekommen.
Um mehr Informationen zu bekommen, hatte ich diesen Thread "gekapert". Ich konnte ja nicht ahnen, wie sich das hinzieht nur um mal nachzufragen, ob ich Daten bekommen kann.
Dabei gibt es wie gesagt nur zwei Möglichkeiten:
1. Stichprobe mit großem n
Hier nicht sinnvol. Die Streuung durch andere Einflüsse erfordert mehr Faktoren.
2. Mit Hilfe mehrerer mittelgroßer Stichproben Momente der Grundgesamtheit
schätzen.
Ja
Möglichst auch noch Schiefe und Wölbung.
Das sind Parameter, die man jederzeit aus den originalen Stichproben berechnen kann und wenn du die von mir angehängten Plots anschaust, siehst du die Werte auch. Wölbung habe ich aber mit Kurtosis benamst. Kurtosis = Wölbung - 3. Wird dadurch einfacher vergleichbar.
Der Haupttreffer im Lotto wäre es, wenn Du herausfinden würdest, dass die
Grundgesamtheiten für verschiedene Pilzarten statistische Ähnlichkeiten
haben, d.h. die Verteilungsfunktionen sind ähnlich.
Dann könntest Du viel höhere Genauigkeiten deiner Schätzungen erreichen.
Ja
Man sollte das Ganze mit einem Zufallsgenerator simulieren, der
normalverteilte Zufallsvariable erzeugt.
Das ist aber tückisch.
Der "Informatik Papst" Donald E. Knuth schreibt zum Beispiel in
seinen Büchern, dass er zahlreiche akademische Arbeiten gefunden hat, die
mit Hilfe solcher Simulationen erzeugt wurden.
In vielen Fällen fand er, dass der verwendete Zufallsgenerator keine
normalverteilten zufälligen Zahlen erzeugt.
Er schrieb dann, dass er eigentlich anregen müsste, den Leuten ihre
akademischen Titel zu entziehen, es aber nicht getan hat.
Gleichverteilung kann man leicht simulieren. Bei anderen Verteilungen, zum
Beispiel solchen mit 2 Maxima, muss man da eine Menge Gehirnschmalz
investieren.
Einzelne Arten scheinen (aus eigener Erfahrung) sehr unterschiedlich Mischpopulationen zu bilden. Keine allgemeine Simulation könnte das abbilden.
Ich pflege seit Anfang diesen Jahres meine 94jährige demente Mutter in
Vollzeit.
Ich muss leider sagen, dass man bei täglichem Umgang mit einem dementen
Menschen selbst sehr acht geben muss, seine eigene geistige Gesundheit zu
erhalten.
Ich habe Sie gestern zum Beispiel zum Zahnarzt gebracht, wo man ihr in einer
2,5 Stunden langen Prozedur ihre drei letzten Zähne gezogen hat.
Sie hatte einen Teil ihres Gebisses in den Müll geworfen und braucht darum
ein neues.
Ich musste bei der Behandlung helfen, weil 2 Menschen es nicht geschafft
haben, sie genügend ruhig zu halten, weil sie die Schmerzen nicht mehr
ertragen konnte.
Puuh, konnte man nicht vorher ein Beruhigungsmittel geben? Da wünsche ich dir jedenfalls noch viel Kraft!
Ich sehe mich darum leider nicht in der Lage momentan derart kniffliges Zeug
zu programmieren.
Ich denke, ich bin auf dem richtigen Weg. Auch diese Diskussion hilft!
Noch ein Wort zu den Analysen von Werner Jurkeit: Er beschreibt alle Merkmale
und gibt Hinweise zu deren Variabilität, die überhaupt zur Pilzbestimmung
herangezogen werden können.
Das geht von "Ist die Huthaut glänzend?" zu "Wie ist das
Sporenornament?"
Er befasst sich sehr genau mit mikroskopischen Merkmalen, von denen ich mir
noch nicht einmal die Namen merken kann.
Ich habe zwar ein kleines Latinum, aber das hilft mir da eher nicht.
Ich kann mir nur die Zeichnungen ansehen und versuchen zu verstehen. Da habe
ich aber noch viel Arbeit vor mir.
Ja, die Variabilität ist immer ein großes Problem. Aber mir geht es auch darum, wenn schon alles ziemlich variabel ist, dass es eine Abkehr von herkömmlichen Größenangaben gibt, weil sie nicht falsifizierbar sind und somit nicht dazu benutzt werden können, zukünftig genauere Aussagen treffen zu können oder sogar die Messungen in Frage zu stellen (z.B. systematische Fehler oder andere Art)
VG, Jens